主视觉标题卡以“GDN-2-3B”为标题,副标题为“一个将 Mamba-2 替换为 Gated DeltaNet-2 的 Nemotron-3 Nano 混合模型——一条推文,没有权重”,三个状态标签分别显示“未发布”“单一来源”和“无基准测试”,页脚一行写着“未经验证的候选版本,在 2026-09-26 的一条 X 帖子中被提及”。右下角为 OrcaRouter 标志。
Guides & Insights

GDN-2-3B 泄露:一款 Nemotron-3 Nano 混合模型,以 Gated DeltaNet-2 取代 Mamba-2

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

2026 年 9 月 26 日发布在 X 上的一句话,就是 GDN-2-3B 迄今为止的全部公开记录。账号 @teortaxesTex 写道:“一个近期发布候选是混合式 GDN-2-3B 潜在 MoE,它沿用 Nemotron-3 Nano 架构,但将 Mamba-2 层替换为 GDN-2。”就这些——没有 Hugging Face 仓库,没有配置文件,没有参数表,没有具名构建者,没有日期。GDN-2-3B 尚未发布,下文任何内容都不应被解读为它已经发布。让这句话仍值得拆解的是,它的两半都指称了真实且可核查的东西:Gated DeltaNet-2 是 NVIDIA 发布的一种线性注意力架构,有公开的 PyTorch 实现,以及一条繁忙的移植轨迹,途经 TPU、Triton 和 ONNX 工具链,而 Nemotron-3 Nano 是 NVIDIA 已发布的开放权重 Mamba-2 混合模型,传闻中的模型正被嫁接到它之上。这是一篇“目前所知”的文章:架构有文档记录,模型是传闻,而这两者之间的区别就是整个故事。

简短版:Gated DeltaNet-2 改变了线性注意力模型编辑其压缩记忆的方式,其实测增益恰恰最集中体现在小型混合模型被采购来承担的长上下文检索任务上。Nemotron-3 Nano 是 NVIDIA 当前混合家族中最小的一档,也最有可能以更廉价的递归机制重新裁剪。把这些放在一起,你就得到一个看似合理的发布候选——而且只有一个人这么说。

这条推文说了什么,又没有说什么

仔细读这句话,因为它异常密集,同时又异常单薄。句中说,这个候选模型是混合型(也就是说,不止一种层类型),3B(参数量小到足以在一张消费级 GPU 上运行),并且采用潜在 MoE(一种 NVIDIA 专家路由设计:token 在到达专家之前会被投影到更小的潜在维度,Super 120B 和 Ultra 550B 层级用的就是这种设计,而已发布的 Nano 层级则没有采用)。句中说,层模式遵循 Nemotron-3 Nano。还说 Mamba-2 层被替换为 GDN-2。

它没有说明的是:是谁在构建它。“一个近期发布候选版本”没有主语。人们很容易从中读出 NVIDIA 的意味——GDN-2 是 NVIDIA 的研究,Nemotron-3 Nano 是 NVIDIA 的模型,因此这种配对看起来像是自家的实验——但那条推文并没有这么说,而第三方今天就可以合法地将两者结合起来,因为 Nemotron-3 Nano 的权重是开放的,Gated DeltaNet-2 的参考代码是公开的。把构建者视为未知。

它也没有说明时间。“近期”是唯一的时间信号,而它并不是一个日期。没有任何可供下载的检查点,没有任何声称能为其提供服务的推理引擎,也找不到任何针对该模型本身的基准测试。本文中的每一个数字都属于 Gated DeltaNet-2,或属于分别发布的 Nemotron-3 Nano。它们没有一个属于 GDN-2-3B。

名字的两半,以及它们为何契合

一分钟了解 Gated DeltaNet-2

线性注意力用固定大小的循环状态取代了 softmax 注意力中无界的 KV 缓存。真正的难点不在于决定遗忘什么——而在于编辑该状态时,不扰乱其中已经存储的关联。Delta 规则模型会在写入新值之前减去当前的读取结果;Kimi Delta Attention 则通过逐通道衰减强化了遗忘。然而,两者仍然由同一个标量门控驱动两个不同的决策:在键一侧要擦除多少旧内容,以及在值一侧要写入多少新内容。

Gated DeltaNet-2 由 NVIDIA 研究人员 Ali Hatamizadeh、Yejin Choi 和 Jan Kautz 发表(arXiv 2605.22791,参考代码在 NVlabs 仓库中),它将该标量拆分为两个通道级门——一个作用于键侧坐标的擦除门和一个作用于值侧坐标的写入门——并保留了通道级衰减。该论文的框架是,这一设计严格推广了此前的成果:将两个门都坍缩为同一个标量,就能恢复 Kimi Delta Attention;再把衰减也一并坍缩,就能恢复更早的 Gated DeltaNet。在消融实验中,NVIDIA 报告称擦除门贡献了大部分增益,这与其在保护键侧关联不被覆写方面的作用相符。

证据是一项匹配参数的研究,而非产品:每个模型都以 1.3B 参数在 100B FineWeb-Edu token 上训练,并且 Mamba-2、Gated DeltaNet、KDA 和 Mamba-3 的循环状态大小保持一致。在循环设置中,Gated DeltaNet-2 以 15.90 的 WikiText 困惑度取得该组最佳,优于 Mamba-2 的 16.79,并以 53.11 的最佳平均常识准确率优于 Mamba-3 的 52.39。在混合设置中——即真正类似 Nemotron-3 Nano 交错模式的那种——其 WikiText 困惑度为 15.62,平均准确率为 53.97,领先于 Mamba-3(15.81 / 52.72),并远超普通 Transformer 基线(19.22 / 50.86)。

优势究竟集中在哪些地方,才是对小型长上下文模型真正关键的部分。在 RULER 的 4K 递归多键大海捞针测试中,Gated DeltaNet-2 得分 37.8,而较旧的 Gated DeltaNet 为 27.8,KDA 为 28.0;在 2K 单针测试中,它得分 89.8,对比 54.2。在六个真实检索数据集(SWDE、SQuAD、FDA、TriviaQA、NQ、DROP)上取平均,它以 29.88 领跑递归类前沿,而 Mamba-2 为 26.84;在混合类前沿则为 42.28,而 KDA 为 40.14。NVIDIA 还报告称,在单块 H100 上吞吐量随序列长度的扩展近乎持平,仅为额外的门控带来相对 KDA 很小的恒定开销。这些都是来自论文自身表格的厂商数据,我们未做复现。

Two-column comparison scoreboard titled 'Mamba-2 vs Gated DeltaNet-2 - the scoreboard'. Left column 'Mamba-2': Decay scalar; Erase gate none; Write gate scalar; WikiText ppl 16.79; LMB ppl 12.38; Retrieval avg 26.84. Right column 'Gated DeltaNet-2': Decay channel-wise; Erase gate channel-wise b; Write gate channel-wise w; WikiText ppl 15.90; LMB ppl 11.41; Retrieval avg 29.88. Footer: both recurrent-only, 1.3B params, 100B FineWeb-Edu tokens, figures per NVIDIA's Gated DeltaNet-2 paper, not independently reproduced. OrcaRouter logo bottom-right.

Nemotron-3 Nano 蓝图

Nemotron-3 Nano 是一种专家混合(Mixture-of-Experts)混合 Mamba-Transformer,被借鉴的是其架构,而非模型本身。30B-A3B 版本有 52 层:23 层 Mamba-2、23 层 MoE,以及 6 层分组查询注意力,每个 MoE 块有 128 个路由专家加 1 个共享专家,每个 token 激活 6 个专家。它拥有 3.5B 活跃参数,总参数为 30B,在 25 万亿 token 上预训练,并支持高达 1M token 的上下文窗口;NVIDIA 自己的技术报告声称,其推理吞吐量比同等规模的开源模型(如 GPT-OSS-20B 和 Qwen3-30B-A3B-Thinking-2507)最高高出 3.3 倍。它依据 NVIDIA Nemotron Open Model License 发布,并明确允许商业使用。

还有一个更小的同门版本值得了解,因为传闻名称中的“3B”与其非常接近:Nemotron-3 Nano 4B 使用 NVIDIA 的 Elastic 框架从 NVIDIA-Nemotron-Nano-9B-v2 压缩而来,它“主要由 Mamba-2 和 MLP 层组成,仅结合了四个 Attention 层”。因此,Nano 这一层级已经是该系列中被压缩和重新裁剪的部分。这就是一个 3B 实验性变体竟然会存在的最合理原因。

有两处不一致值得点出,而不是粉饰过去。首先,在已发布的家族中,大型层级——Nemotron-3 Super 120B-A12B 和 Nemotron-3 Ultra 550B-A55B——才使用 latent MoE;Nano 层级则不是。因此,“Nano 形态的 latent MoE”并不是对现有 NVIDIA 配置的直接移植,而是两个层级思路的重新组合,而这类东西通常先出现在研究检查点中,然后才出现在产品里。其次,Nano 家族的 MoE 块采用稠密专家路由;转向 latent 路由会改变每个专家层的 FLOP 特征,所以在配置文件出现之前,3B 这个标签几乎无法告诉你该模型实际的服务成本是多少。

移植路径是真实的——模型却不是

可以证实的是,Gated DeltaNet-2 正在被快速适配进生产运行时。2026年9月23日,OpenXLA 的 Tokamax 代码仓库的一个拉取请求为 TPU 添加了 Gated Delta Net 2 Pallas 内核和算子,其中包括跨六个输入的自动微分反向传播,以及在 Cloud TPU v7x 上的基准测试数据。Flash Linear Attention 自6月下旬以来一直带有融合的 GDN-2 预填充内核——该处的拉取请求报告在 H100 上平均预填充加速 2.48 倍、最佳情况 5.13 倍——并在9月后续修复了一个门控排序 bug 并优化了分块训练路径。ONNX 有一个针对其提交的未解决规范缺口,因为 opset 27 的 LinearAttention 算子无法表达 GDN-2 的逐通道擦除门。而 NVIDIA 自家的 Megatron-Bridge 在3月为混合 GDN 层和 latent-MoE 压缩都添加了 FLOPs 核算。

这些都不是模型发布,把它解读成模型发布会是个错误。内核工作是基础设施;它说明某个架构正被认真对待,而不是说已经存在一个检查点。它确实给了你一个可以具体监控的东西:如果 GDN-2 混合模型真的问世,它会先以对某个服务引擎的支持形式落地,然后才作为公告出现,而引擎支持已经部分就位。Tokamax 和 Flash Linear Attention 的工作也是最有力的论据,说明推文中的这种配对在技术上自洽,而非凭空编造——服务 GDN-2 混合模型所需的组件,正由并非写那条推文的人在构建。

Screenshot of the NVlabs/GatedDeltaNet-2 GitHub repository page in English: the title 'Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention', the file list with README.md, LICENSE, SECURITY.md and lit_gpt/scripts directories, and the About panel showing 317 stars, 33 forks and a last commit from last month.

如果3B GDN-2混合模型真的发布,它为何重要

支持这一组合的理由是经济性,而非基准测试驱动。一个具有固定大小循环状态的 3B 级混合模型,是那种可以在一块消费级 GPU 上运行、且无需使用会随提示词增长的 KV cache 的模型,而这正是 Nemotron-3 Nano 4B 已经做出的同样取舍。根据论文的数据,将 Mamba-2 层换成 GDN-2,可以在相同状态大小下换来更好的多键检索以及更好的真实场景检索平均值——而这正是较旧的 delta 规则家族最薄弱的两个地方。这是一种有针对性的升级,而不是代际升级,并且这类改动值得投入 3B 的参数。

这也提醒我们,小模型中真正有趣的竞争已经从参数量转向了记忆设计。一个 3B 模型,其循环状态是固定张量,在长提示下的表现与带有量化 KV 缓存的 3B transformer 不同:内存占用是恒定的,但模型对于它能记住的内容有一个固定预算,而它遗忘得有多优雅,如今成了规格。Gated DeltaNet-2 的全部贡献就是一条更好的遗忘规则。这使得它本身就是一个值得关注的设计,即使 GDN-2-3B 从未以这个名字出现。

你实际上会如何测试这样的东西

当一种尚未经过验证的架构进入服务运行时,对多数团队来说,阻碍并不在于那张基准测试表——而在于采用它就意味着新的集成、新的契约和新的故障模式,而且面对的是一个毫无生产历史的模型。这首先是路由问题,其次才是模型问题。一个聚合平台若能把新端点放在你已经在用的同一个密钥之后,就意味着你可以把一部分真实流量发给它,保留现有模型作为回退,并让 自动故障转移在新路由尚不稳定时接住错误——一个 API 覆盖 200+ 模型,以供应商标价、0% 加价,因此当初报价即实付价,供应商降价当天就能体现,而不必等到下一张账单。GDN-2-3B 本身并未在任何地方托管,无论是我们还是其他任何人;这正是“未发布”的含义。关键在于,等到它真正可用的那一天,你会用上的就是这套模式。

如果你想了解目前有哪些混合模型和长上下文模型可供路由,实时模型目录才是诚实的清单——它标明的是真正可提供服务的内容,而非仅仅是已经公布的内容。

Screenshot of the OrcaRouter model catalogue at orcarouter.ai/models, headline '204 models - 16 providers - one API key, one bill', with the filter rail for input modalities, context length, input price, status and series, the Models / Leaderboard / Offers / playground tabs, and a 'How to call any model' panel.

该关注什么,以及什么会证伪这一点

泄露会以三种方式之一得到解决,而每一种都有迹可循:

• 一个配置文件——最有力的确认将是一份 Nemotron-H 风格的配置,以混合覆盖模式列出 GDN-2 层类型。在这样的 config.json 出现之前,一切都只是根据一句话做出的推断。

• 针对特定检查点的引擎支持——GDN-2 内核已经存在;真正不存在的,是任何声称能够服务某个具名 GDN-2 混合模型的引擎。这一缺口的填补才是真正的信号。

• 许可证变更——这一点很容易被忽略。Gated DeltaNet-2 的参考代码是以 NVIDIA Source Code License-NC 发布的,该许可证为非商业许可,而 Nemotron 模型权重则依据 NVIDIA Nemotron Open Model License 发布,后者并非非商业许可。若将两者结合成一个混合体,就必须化解这一矛盾,而它如何化解,则能说明最终成果究竟是一个研究产物,还是你可以部署的东西。

有两件事会证伪这里的说法。如果名称中的“3B”最终指的不是总参数量——而是活跃参数量、层数,或干脆只是个代号——那经济账就完全变了。而如果“latent MoE”这个说法最终描述的只是一个普通的 MoE 模块,那么这就比看起来小得多:只是换了个线性层的 Nano 重切版,而不是一种新形态。

这引发的问题

Gated DeltaNet-2 与 Qwen3.8 中已有的 Gated DeltaNet 有何不同?

早期的 Gated DeltaNet 对擦除和写入都使用单一标量门;Gated DeltaNet-2 将其拆分为两个通道级门控,并加入了从 Kimi Delta Attention 借鉴而来的通道级衰减。因此,它是严格意义上的泛化,而不是替代方案;实际差异体现在检索上,而不是困惑度上——多键大海捞针任务上的差距远大于 WikiText 上的差距。

为什么会有人用 GDN-2 换掉 Mamba-2,而不是干脆堆更多 Mamba-2 层?

因为在匹配的循环状态规模下,论文测得 Gated DeltaNet-2 在长上下文智能体工作负载实际会用到的检索任务上更优,代价是吞吐量上有小幅恒定开销。如果你的工作负载检索密集,这种取舍是有利的;如果在短上下文下受吞吐量约束,Mamba-2 基线则是更便宜的选择。用 3B 测试平台来判断你的流量更像哪一种,是明智的做法。

各组成部分的开源状态是否意味着该模型也会开源?

不。Nemotron-3 Nano 的权重是开放的,Gated DeltaNet-2 的参考代码是公开的,但这两个事实都不迫使任何人发布基于它们构建的检查点——而且 GDN-2 代码上的非商业许可证意味着商业发布需要另行安排。可能的结果从 NVIDIA 在 Nemotron Open Model License 下发布研究成果,到某种永远不会离开内部集群的东西,不一而足。

今天有什么可以尝试的吗?

是的,但不是 GDN-2-3B。Gated DeltaNet-2 论文的检查点可在 NVlabs 仓库中基于 FineWeb-Edu 以 1.3B 规模复现,而 Nemotron-3 Nano 30B-A3B 和 4B 如今已能在 vLLM、SGLang、TensorRT-LLM 和 llama.cpp 上运行。测试其中一半,就能知道另一半大概会怎样——这比那条推文提供的信息更多。

这一切都不能使 GDN-2-3B 成真。它只是让它变得可证伪,而这是一句话所能提供的最多东西:它距离成为真正的近期发布,或一个听起来合理却永远不会被构建出来的重组,只差一个配置文件、一项引擎声明或一个代码仓库。