
GDN-2-3B-Leak: ein Nemotron-3-Nano-Hybrid mit Gated DeltaNet-2 anstelle von Mamba-2
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 477 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 187 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
Ein einzelner Satz, der am 26. September 2026 auf X gepostet wurde, ist die gesamte öffentliche Aufzeichnung von GDN-2-3B bislang. Der Account @teortaxesTex schrieb, dass „ein kurzfristiger Release-Kandidat das hybride GDN-2-3B-Latent-MoE ist, das der Nemotron-3 Nano-Architektur folgt, aber die Mamba-2-Schichten durch GDN-2 ersetzt.“ Das ist alles – kein Hugging-Face-Repository, keine Konfigurationsdatei, keine Parametertabelle, kein namentlich genannter Entwickler, kein Datum. GDN-2-3B wurde nicht veröffentlicht, und nichts im Folgenden sollte so gelesen werden, als wäre es veröffentlicht worden. Was den Satz dennoch wert macht, auseinandergenommen zu werden, ist, dass beide Hälften davon etwas Reales und Überprüfbares benennen: Gated DeltaNet-2 ist eine von NVIDIA veröffentlichte Linear-Attention-Architektur mit einer öffentlichen PyTorch-Implementierung und einer regen Portierungsspur durch TPU-, Triton- und ONNX-Tooling, und Nemotron-3 Nano ist der von NVIDIA ausgelieferte Open-Weights-Mamba-2-Hybrid, auf den das gemunkelte Modell aufgepfropft wird. Dies ist ein Was-wir-bisher-wissen-Beitrag: Die Architektur ist dokumentiert, das Modell ist ein Gerücht, und der Unterschied zwischen diesen beiden Dingen ist die ganze Geschichte.
Die Kurzfassung: Gated DeltaNet-2 verändert die Art der Bearbeitung: Ein Linear-Attention-Modell bearbeitet seinen komprimierten Speicher, und seine gemessenen Zugewinne schlagen am stärksten genau auf die Long-Context-Retrieval-Arbeit durch, für die ein kleiner Hybrid gekauft wird. Nemotron-3 Nano ist die kleinste Stufe in NVIDIAs aktueller Hybridfamilie und diejenige, die am wahrscheinlichsten mit einer günstigeren Rekurrenz neu zugeschnitten wird. Nimmt man beides zusammen, hat man einen plausiblen Release-Kandidaten — und genau eine Person, die das behauptet.
Was der Tweet sagt und was nicht
Lies den Satz genau, denn er ist gleichzeitig ungewöhnlich dicht und ungewöhnlich dünn. Der Satz besagt, der Kandidat sei hybrid (also mehr als ein Schichttyp), 3B (eine Parameteranzahl, klein genug, um auf einer einzelnen Consumer-GPU zu laufen), und ein latentes MoE (ein NVIDIA-Experten-Routing-Design, bei dem Tokens in eine kleinere latente Dimension projiziert werden, bevor sie die Experten erreichen, was die Stufen Super 120B und Ultra 550B verwenden und was die ausgelieferte Nano-Stufe nicht verwendet). Er besagt, dass das Schichtmuster Nemotron-3 Nano folgt. Und er besagt, dass die Mamba-2-Schichten durch GDN-2 ersetzt werden.
Was es nicht sagt: wer es baut. „One near-term release candidate“ hat kein Subjekt. Es ist verlockend, NVIDIA hineinzulesen – GDN-2 ist NVIDIA-Forschung und Nemotron-3 Nano ist ein NVIDIA-Modell, daher wirkt die Paarung wie ein hausinternes Experiment –, aber der Tweet sagt das nicht, und ein Dritter kann die beiden heute legal kombinieren, weil die Nemotron-3 Nano-Gewichte offen und der Gated DeltaNet-2-Referenzcode öffentlich ist. Betrachte den Erbauer als unbekannt.
Es wird auch nicht gesagt, wann. „Kurzfristig“ ist das einzige Zeitsignal, und es ist kein Datum. Es gibt keinen Checkpoint zum Herunterladen, keine Inferenz-Engine, die behauptet, es bereitzustellen, und nirgends einen Benchmark des Modells selbst. Jede Zahl in diesem Artikel gehört zu Gated DeltaNet-2 oder zu Nemotron-3 Nano in der jeweils separat veröffentlichten Form. Keine davon gehört zu GDN-2-3B.
Die beiden Hälften des Namens – und warum sie zusammenpassen
Gated DeltaNet-2 in einer Minute
Lineare Attention ersetzt den unbegrenzten KV-Cache von Softmax-Attention durch einen rekurrenten Zustand fester Größe. Das Schwierige ist nicht die Entscheidung, was vergessen werden soll – sondern diesen Zustand zu bearbeiten, ohne die bereits darin gespeicherten Assoziationen durcheinanderzubringen. Delta-Regel-Modelle subtrahieren die aktuelle Auslesung, bevor sie einen neuen Wert schreiben; Kimi Delta Attention schärfte das Vergessen mit kanalweiser Abklingung. Beide treiben jedoch immer noch zwei verschiedene Entscheidungen über ein einziges skalares Gate: wie viel alter Inhalt auf der Key-Seite gelöscht und wie viel neuer Inhalt auf der Value-Seite übernommen werden soll.
Gated DeltaNet-2, veröffentlicht von den NVIDIA-Forschern Ali Hatamizadeh, Yejin Choi und Jan Kautz (arXiv 2605.22791, Referenzcode im NVlabs-Repository), teilt diesen Skalar in zwei kanalweise Gates auf – ein Lösch-Gate über key-seitige Koordinaten und ein Schreib-Gate über value-seitige Koordinaten – und behält den kanalweisen Decay bei. Das Paper stellt es so dar, dass das Design streng verallgemeinert, was zuvor kam: Reduziert man beide Gates auf denselben Skalar, erhält man Kimi Delta Attention zurück; reduziert man zusätzlich den Decay, erhält man das frühere Gated DeltaNet zurück. In der Ablation berichtet NVIDIA, dass das Lösch-Gate für den größten Teil des Gewinns verantwortlich ist, was zu seiner Rolle passt, key-seitige Assoziationen davor zu schützen, überschrieben zu werden.
Die Evidenz ist eine parameterabgeglichene Studie, kein Produkt: Jedes Modell wurde mit 1,3B Parametern auf 100B FineWeb-Edu-Tokens trainiert, wobei die rekurrente Zustandsgröße über Mamba-2, Gated DeltaNet, KDA und Mamba-3 hinweg gleich gehalten wurde. Im rekurrenten Setting erzielt Gated DeltaNet-2 die beste WikiText-Perplexität der Gruppe mit 15,90 gegenüber den 16,79 von Mamba-2 und die beste durchschnittliche Commonsense-Genauigkeit mit 53,11 gegenüber den 52,39 von Mamba-3. Im Hybrid-Setting – demjenigen, das tatsächlich dem verschachtelten Muster von Nemotron-3 Nano ähnelt – sind es 15,62 WikiText-Perplexität und 53,97 durchschnittliche Genauigkeit, vor Mamba-3 (15,81 / 52,72) und deutlich vor einer einfachen Transformer-Baseline (19,22 / 50,86).
Wo sich der Vorteil konzentriert, ist der Teil, der für ein kleines Long-Context-Modell zählt. Beim rekurrenten Multi-Key-Nadel-im-Heuhaufen-Test von RULER bei 4K erzielt Gated DeltaNet-2 37,8 gegenüber 27,8 für das ältere Gated DeltaNet und 28,0 für KDA; beim Single-Needle-Test bei 2K erzielt es 89,8 gegenüber 54,2. Gemittelt über sechs echte Retrieval-Sets (SWDE, SQuAD, FDA, TriviaQA, NQ, DROP) führt es die rekurrente Front mit 29,88 gegenüber 26,84 für Mamba-2 an und die hybride Front mit 42,28 gegenüber 40,14 für KDA. NVIDIA berichtet außerdem von einer nahezu flachen Durchsatzskalierung mit der Sequenzlänge auf einer einzelnen H100, mit nur einem kleinen konstanten Overhead gegenüber KDA für die zusätzlichen Gates. Dies sind Herstellerangaben aus den eigenen Tabellen des Papers, von uns nicht reproduziert.

Der Nemotron-3 Nano-Bauplan
Nemotron-3 Nano ist ein Mixture-of-Experts-Hybrid-Mamba-Transformer, und es ist die Architektur, die übernommen wird, nicht das Modell. Die 30B-A3B-Version umfasst 52 Schichten: 23 Mamba-2-Schichten, 23 MoE-Schichten und sechs Grouped-Query-Attention-Schichten, mit 128 gerouteten Experten plus einem geteilten Experten pro MoE-Block und sechs aktiven Experten pro Token. Es trägt 3,5B aktive Parameter gegenüber 30B insgesamt, wurde auf 25 Billionen Token vortrainiert und unterstützt Kontextfenster von bis zu 1M Token; NVIDIAs eigener technischer Bericht beansprucht bis zu 3,3-mal höheren Inferenzdurchsatz als gleich große offene Modelle wie GPT-OSS-20B und Qwen3-30B-A3B-Thinking-2507. Es wird unter der NVIDIA Nemotron Open Model License veröffentlicht und ist ausdrücklich für die kommerzielle Nutzung freigegeben.
Es gibt ein kleineres Geschwisterchen, das man kennen sollte, denn das „3B“ im gerüchteweise kursierenden Namen kommt ihm ziemlich nahe: Nemotron-3 Nano 4B, komprimiert aus NVIDIA-Nemotron-Nano-9B-v2 mithilfe von NVIDIAs Elastic-Framework, besteht „hauptsächlich aus Mamba-2- und MLP-Schichten, kombiniert mit nur vier Attention-Schichten“. Die Nano-Stufe ist also bereits der Teil der Familie, der zusammengestaucht und neu zugeschnitten wird. Das ist der mit Abstand plausibelste Grund dafür, dass eine experimentelle 3B-Variante überhaupt existieren würde.
Zwei Unstimmigkeiten sollten eher angemerkt als beschönigt werden. Erstens sind es in der ausgelieferten Familie die großen Stufen — Nemotron-3 Super 120B-A12B und Nemotron-3 Ultra 550B-A55B —, die latente MoE verwenden; die Nano-Stufe nicht. Eine „Nano-förmige latente MoE“ ist daher keine direkte Portierung einer bestehenden NVIDIA-Konfiguration, sondern eine Rekombination der Ideen zweier Stufen, und genau das ist die Art von Sache, die in Forschungs-Checkpoints auftaucht, bevor sie in einem Produkt auftaucht. Zweitens sind die MoE-Blöcke der Nano-Familie Dense-Expert-geroutet; der Wechsel zu latentem Routing verändert das FLOP-Profil jeder Expertenschicht, sodass ein 3B-Label Ihnen sehr wenig darüber sagen würde, was die Bereitstellung des Modells tatsächlich kostet, bis eine Konfigurationsdatei auftaucht.
Die Portierungsspur ist real — das Modell nicht
Verifizierbar ist, dass Gated DeltaNet-2 mit hoher Geschwindigkeit in Produktions-Runtimes integriert wird. Am 23. September 2026 fügte ein Pull Request an das Tokamax-Repository von OpenXLA einen Gated Delta Net 2 Pallas-Kernel und -Operator für TPU hinzu, einschließlich eines Autograd-Backward-Passes über sechs Eingaben und Benchmark-Zahlen auf Cloud TPU v7x. Flash Linear Attention enthält seit Ende Juni fusionierte GDN-2-Prefill-Kernel – der dortige Pull Request berichtet von einer durchschnittlichen Prefill-Beschleunigung von 2,48x und einem Bestfall von 5,13x auf einer H100 –, wobei Nachfolge-PRs im September einen Gate-Reihenfolge-Bug behoben und den Chunk-Training-Pfad optimierten. Bei ONNX wurde eine offene Spezifikationslücke gemeldet, weil der LinearAttention-Operator von Opset 27 das kanalweise Erase-Gate von GDN-2 nicht ausdrücken kann. Und NVIDIAs eigenes Megatron-Bridge fügte im März eine FLOPs-Bilanzierung sowohl für hybride GDN-Schichten als auch für Latent-MoE-Kompression hinzu.
Nichts davon ist eine Modellveröffentlichung, und es wäre ein Fehler, es als eine solche zu lesen. Kernel-Arbeit ist Infrastruktur; sie sagt, dass eine Architektur ernst genommen wird, nicht dass ein Checkpoint existiert. Was es dir aber gibt, ist ein konkreter Anhaltspunkt zur Beobachtung: Falls ein GDN-2-Hybrid tatsächlich das Licht der Welt erblickt, wird er zuerst als Unterstützung, die in einer Serving-Engine landet, und erst danach als Ankündigung auftauchen, und die Engine-Unterstützung ist bereits teilweise vorhanden. Die Arbeit an Tokam und Flash Linear Attention ist außerdem das stärkste Argument dafür, dass die Paarung im Tweet technisch kohärent und nicht erfunden ist – die Teile, die benötigt werden, um einen GDN-2-Hybrid zu bedienen, werden von Leuten gebaut, die nicht die Person sind, die den Tweet geschrieben hat.

Warum ein 3B-GDN-2-Hybrid von Bedeutung wäre, wenn er ausgeliefert wird
Das Argument für die Kombination ist wirtschaftlich begründet, nicht benchmarkgetrieben. Ein Hybrid der 3B-Klasse mit einem rekurrenten Zustand fester Größe ist ein Modell, das man auf einer einzigen Consumer-GPU betreiben kann, ohne einen KV-Cache, der mit dem Prompt wächst – derselbe Kompromiss, den Nemotron-3 Nano 4B bereits eingeht. Der Austausch der Mamba-2-Schichten durch GDN-2 bringt – den Zahlen des Papers zufolge – bessere Multi-Key-Retrieval- und bessere Real-World-Retrieval-Durchschnittswerte bei gleicher Zustandsgröße – genau die beiden Bereiche, in denen die ältere Delta-Regel-Familie am schwächsten war. Das ist ein gezieltes Upgrade, kein generationelles, und es ist die Art von Änderung, die 3B an Parametern wert wäre.
Es ist auch eine Erinnerung daran, dass sich der interessante Wettbewerb bei kleinen Modellen von der Parameteranzahl hin zum Speicherdesign verlagert hat. Ein 3B-Modell, dessen rekurrenter Zustand ein fester Tensor ist, verhält sich bei langen Prompts anders als ein 3B-Transformer mit einem quantisierten KV-Cache: Der Speicher ist flach, aber das Modell hat ein festes Budget dafür, woran es sich erinnern kann, und wie elegant es vergisst, ist jetzt die Spezifikation. Der gesamte Beitrag von Gated DeltaNet-2 ist eine bessere Vergessensregel. Das macht es zu einem Design, das man aus eigenen Gründen im Auge behalten sollte, selbst wenn GDN-2-3B nie unter diesem Namen erscheint.
Wie man so etwas tatsächlich testen würde
Wenn eine unbewiesene Architektur in einer Serving-Runtime landet, ist der Blocker für die meisten Teams nicht die Benchmark-Tabelle – sondern dass ihre Einführung eine neue Integration, einen neuen Vertrag und einen neuen Fehlermodus bedeutet, und das alles gegen ein Modell ohne Produktionshistorie. Das ist ein Routing-Problem, bevor es ein Modellproblem ist. Ein Aggregator, der einen neuen Endpoint hinter denselben Schlüssel legt, den Sie bereits nutzen, bedeutet: Sie können einen Teil des echten Traffics dorthin schicken, Ihr bestehendes Modell als Fallback behalten und automatisches Failover die Fehler abfangen lassen, während die neue Route noch instabil ist – eine API über 200+ Modelle zum Listenpreis des Anbieters mit 0 % Aufschlag, sodass der Preis, der Ihnen genannt wurde, auch der Preis ist, den Sie zahlen, und eine Preissenkung des Anbieters noch am selben Tag sichtbar wird statt erst auf der nächsten Rechnung. GDN-2-3B selbst wird nirgendwo gehostet, weder von uns noch von jemand anderem; genau das bedeutet „unreleased“. Der Punkt ist das Muster, das Sie an dem Tag verwenden würden, an dem es so weit ist.
Wenn Sie sehen möchten, welche Hybrid- und Langkontextmodelle heute routingfähig sind, ist der Live-Modellkatalog die ehrliche Liste – er kennzeichnet, was tatsächlich bereitgestellt werden kann und nicht, was angekündigt wurde.

Worauf zu achten ist – und was dies falsifizieren würde
Das Leck löst sich auf eine von drei Arten auf, und jede hat ein verräterisches Anzeichen:
• Eine Konfigurationsdatei — die stärkste einzelne Bestätigung wäre eine Konfiguration im Nemotron-H-Stil, die GDN-2-Schichttypen in einem hybriden Override-Muster auflistet. Bis eine solche config.json existiert, ist alles nur eine Schlussfolgerung aus einem Satz.
• Engine-Unterstützung für einen bestimmten Checkpoint — GDN-2-Kernel existieren bereits; was nicht existiert, ist eine Engine, die behauptet, einen benannten GDN-2-Hybrid zu bedienen. Dass sich diese Lücke schließt, ist das eigentliche Signal.
• Eine Lizenzänderung — diese ist leicht zu übersehen. Der Referenzcode von Gated DeltaNet-2 wird unter der NVIDIA Source Code License-NC veröffentlicht, die nicht kommerziell ist, während die Nemotron-Modellgewichte unter der NVIDIA Nemotron Open Model License vertrieben werden, die es nicht ist. Ein Hybrid, der beides kombinierte, müsste diese Spannung auflösen, und wie er sie auflöst, verrät, ob das Ergebnis ein Forschungsartefakt oder etwas ist, das man einsetzen könnte.
Zwei Dinge würden die hiesige Rahmung widerlegen. Wenn sich herausstellt, dass die „3B“ im Namen etwas anderes als die Gesamtparameter bedeutet – aktive Parameter, eine Schichtanzahl oder einfach nur ein Codename –, ändert sich die Wirtschaftlichkeit vollständig. Und wenn sich herausstellt, dass die Formulierung „latent MoE“ einen schlichten MoE-Block beschreibt, dann ist das eine viel kleinere Idee, als es aussieht: ein Nano-Neuzuschnitt mit einer anderen linearen Schicht, keine neue Form.
Fragen, die dies aufwirft
Wie unterscheidet sich Gated DeltaNet-2 von dem Gated DeltaNet, das bereits in Qwen3.8 enthalten ist?
Das frühere Gated DeltaNet verwendet ein einzelnes skalares Gate sowohl zum Löschen als auch zum Schreiben; Gated DeltaNet-2 teilt es in zwei kanalweise Gates auf und fügt einen kanalweisen Decay hinzu, der von Kimi Delta Attention übernommen wurde. Es ist also eine strikte Verallgemeinerung statt eines Ersatzes, und der praktische Unterschied zeigt sich beim Retrieval, nicht bei der Perplexität – die Lücke bei Multi-Key-Needle-in-a-Haystack ist weit größer als die Lücke bei WikiText.
Warum sollte jemand Mamba-2 gegen GDN-2 austauschen, statt einfach mehr Mamba-2-Schichten auszuliefern?
Denn bei übereinstimmender Größe des rekurrenten Zustands misst das Paper Gated DeltaNet-2 bei den Retrieval-Aufgaben vorn, die Long-Context-Agentic-Workloads tatsächlich ausüben, um den Preis eines kleinen konstanten Overheads beim Durchsatz. Wenn Ihr Workload retrieval-lastig ist, ist dieser Trade-off günstig; wenn er bei kurzem Kontext durchsatzgebunden ist, ist die Mamba-2-Baseline die günstigere Antwort. Ein 3B-Testbed ist ein sinnvoller Weg, um herauszufinden, welchem der beiden Ihr Traffic ähnelt.
Bedeutet der Open-Source-Status der Einzelteile, dass auch das Modell offen wäre?
Nein. Die Gewichte von Nemotron-3 Nano sind offen und der Referenzcode von Gated DeltaNet-2 ist öffentlich, aber keine dieser beiden Tatsachen verpflichtet irgendjemanden, einen daraus erstellten Checkpoint zu veröffentlichen – und die nichtkommerzielle Lizenz für den GDN-2-Code bedeutet, dass eine kommerzielle Veröffentlichung eine andere Vereinbarung erfordern würde. Die plausiblen Ergebnisse reichen von einer NVIDIA-Forschungsveröffentlichung unter der Nemotron Open Model License bis hin zu etwas, das einen internen Cluster nie verlässt.
Gibt es heute irgendetwas zum Ausprobieren?
Ja, aber nicht GDN-2-3B. Die Checkpoints des Gated DeltaNet-2-Papers lassen sich aus dem NVlabs-Repository bei 1,3B auf FineWeb-Edu reproduzieren, und Nemotron-3 Nano 30B-A3B und 4B laufen heute auf vLLM, SGLang, TensorRT-LLM und llama.cpp. Wenn man eine der beiden Hälften testet, weiß man, was die andere wahrscheinlich tun würde – was mehr ist, als der Tweet hergibt.
Nichts davon macht GDN-2-3B real. Es macht es falsifizierbar, und das ist das Höchste, was ein einzelner Satz bieten kann: nur eine Konfigurationsdatei, eine Engine-Behauptung oder ein Repository davon entfernt, entweder eine echte kurzfristige Veröffentlichung oder eine plausibel klingende Neukombination zu sein, die nie gebaut wird.
