主視覺標題卡以「GDN-2-3B」為標題,副標題為「一款將 Mamba-2 換成 Gated DeltaNet-2 的 Nemotron-3 Nano 混合模型——一則推文,沒有權重」,三個狀態標籤分別寫著「未發布」、「單一來源」與「無基準測試」,而頁尾一行則寫著「於 2026-09-26 在單一 X 貼文中提及的未經驗證的發布候選版本。」OrcaRouter 標誌位於右下角。
Guides & Insights

GDN-2-3B 洩露:一個 Nemotron-3 Nano 混合模型,以 Gated DeltaNet-2 取代 Mamba-2

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

2026年9月26日發布於 X 的一句話,是GDN-2-3B迄今為止全部的公開紀錄。帳號 @teortaxesTex 寫道:「一個近期的發布候選版本是混合式 GDN-2-3B 潛在 MoE,它遵循 Nemotron-3 Nano 架構,但以 GDN-2 取代 Mamba-2 層。」就這樣——沒有 Hugging Face 儲存庫、沒有設定檔、沒有參數表、沒有具名建構者、沒有日期。GDN-2-3B 尚未發布,以下任何內容都不應被解讀為它已經發布。不過,這句話仍值得拆解,因為它的兩個部分都點出了真實且可查證的東西:Gated DeltaNet-2是 NVIDIA 發表的線性注意力架構,具有公開的 PyTorch 實作,以及經由 TPU、Triton 和 ONNX 工具鏈的熱絡移植軌跡;而Nemotron-3 Nano是 NVIDIA 已推出的開放權重 Mamba-2 混合模型,傳聞中的模型正被嫁接於其上。這是一篇「目前已知」的文章:架構有文件記載,模型是傳聞,而這兩者之間的差異就是整個故事。

簡短版:Gated DeltaNet-2 改變了線性注意力模型編輯其壓縮記憶的方式,而其實測增益最明顯落實在小型混合模型被購置來處理的長上下文檢索工作上。Nemotron-3 Nano 是 NVIDIA 目前混合模型家族中最小的一個層級,也最有可能以更便宜的遞迴機制重新裁切。把這些湊在一起,你就得到一個看似可行的發布候選——而且恰好只有一個人這麼說。

這則推文說了什麼、沒說什麼

請仔細閱讀這句話,因為它同時異常密集又異常單薄。這句話說這個候選模型是混合式(因此,不只一種層類型)、3B(參數量小到足以在單一消費級 GPU 上執行),以及潛在 MoE(一種 NVIDIA 專家路由設計,其中符元會在抵達專家之前先被投影到較小的潛在維度;Super 120B 與 Ultra 550B 層級採用這種設計,而已出貨的 Nano 層級則沒有採用)。它說層模式遵循 Nemotron-3 Nano。而且它說 Mamba-2 層被替換成 GDN-2。

它沒說的是:誰在打造它。「一個近期的發布候選版本」沒有主詞。人們很容易從中讀出 NVIDIA——GDN-2 是 NVIDIA 的研究,Nemotron-3 Nano 是 NVIDIA 的模型,所以這個配對看起來像一場自家實驗——但這則推文並沒有這麼說,而且第三方今天就能合法地將兩者結合起來,因為 Nemotron-3 Nano 的權重是開放的,而 Gated DeltaNet-2 的參考程式碼是公開的。請把打造者視為未知。

它也沒有說明是在何時。「近期」是唯一的時程訊號,而它不是一個日期。沒有可下載的檢查點,沒有宣稱能提供它的推論引擎,也沒有任何地方有該模型本身的基準測試。本文中的每一項數字,都屬於各自另行發表的 Gated DeltaNet-2 或 Nemotron-3 Nano。這些數字都不屬於 GDN-2-3B。

名稱的兩個部分,以及它們為何契合。

一分鐘了解 Gated DeltaNet-2

線性注意力以固定大小的遞迴狀態,取代了 softmax 注意力中無界的 KV 快取。困難之處不在於決定要忘記什麼——而在於編輯該狀態時,不擾亂其中已儲存的關聯。Delta 規則模型在寫入新值之前,會先減去當前的讀取;Kimi Delta Attention 則以逐通道衰減強化了遺忘機制。然而,兩者仍然以單一純量閘控來驅動兩個不同的決策:在鍵側要抹除多少舊內容,以及在值側要提交多少新內容。

Gated DeltaNet-2 由 NVIDIA 研究人員 Ali Hatamizadeh、Yejin Choi 與 Jan Kautz 發表(arXiv 2605.22791,參考程式碼位於 NVlabs 儲存庫),將該純量拆分成兩個通道閘——一個作用於鍵側座標的抹除閘,以及一個作用於值側座標的寫入閘——並保留通道式衰減。該論文的核心論述是,此設計嚴格推廣了先前的做法:把兩個閘都收攏為同一個純量,就能還原 Kimi Delta Attention;若連衰減也一併收攏,則可還原先前的 Gated DeltaNet。在消融實驗中,NVIDIA 報告指出抹除閘貢獻了大部分的增益,這也符合它在保護鍵側關聯不被覆寫方面的角色。

這些證據來自一項參數匹配的研究,而非產品:每個模型都以 1.3B 參數、在 100B FineWeb-Edu token 上訓練,且 Mamba-2、Gated DeltaNet、KDA 與 Mamba-3 的循環狀態大小保持一致。在循環設定下,Gated DeltaNet-2 以 15.90 的 WikiText 困惑度位居該組之冠,優於 Mamba-2 的 16.79,其常識平均準確率 53.11 也是最佳,勝過 Mamba-3 的 52.39。在混合設定下——也就是真正近似 Nemotron-3 Nano 交錯模式的那一種——其 WikiText 困惑度為 15.62、平均準確率為 53.97,領先 Mamba-3(15.81 / 52.72),也大幅領先純 Transformer 基準(19.22 / 50.86)。

優勢集中的地方,正是對小型長上下文模型而言最要緊的部分。在 RULER 於 4K 的循環多鍵大海撈針測試中,Gated DeltaNet-2 得分 37.8,相較之下較舊的 Gated DeltaNet 為 27.8、KDA 為 28.0;在 2K 的單鍵測試中,它得分 89.8,相較之下為 54.2。在六個真實檢索資料集(SWDE、SQuAD、FDA、TriviaQA、NQ、DROP)上平均,它以 29.88 領先循環前沿,高於 Mamba-2 的 26.84;並以 42.28 領先混合前沿,高於 KDA 的 40.14。NVIDIA 也報告,在單一 H100 上,吞吐量隨序列長度大致持平,相較 KDA 僅因額外閘控帶來少量固定額外負擔。這些是來自論文自身表格的廠商數據,我們並未重現。

Two-column comparison scoreboard titled 'Mamba-2 vs Gated DeltaNet-2 - the scoreboard'. Left column 'Mamba-2': Decay scalar; Erase gate none; Write gate scalar; WikiText ppl 16.79; LMB ppl 12.38; Retrieval avg 26.84. Right column 'Gated DeltaNet-2': Decay channel-wise; Erase gate channel-wise b; Write gate channel-wise w; WikiText ppl 15.90; LMB ppl 11.41; Retrieval avg 29.88. Footer: both recurrent-only, 1.3B params, 100B FineWeb-Edu tokens, figures per NVIDIA's Gated DeltaNet-2 paper, not independently reproduced. OrcaRouter logo bottom-right.

Nemotron-3 Nano 藍圖

Nemotron-3 Nano 是一種混合專家(Mixture-of-Experts)的 Mamba-Transformer 混合架構;被借用的是架構,而不是模型本身。30B-A3B 版本有 52 層:23 層 Mamba-2、23 層 MoE,以及六層分組查詢注意力(grouped-query attention),每個 MoE 區塊有 128 個路由專家加上一個共享專家,且每個 token 有六個專家處於作用中。它的總參數為 30B,其中 3.5B 為作用中參數,並以 25 兆個 token 進行預訓練,支援最高達 1M 個 token 的上下文視窗;NVIDIA 自家的技術報告聲稱,其推論吞吐量最高可達規模相近的開放模型(例如 GPT-OSS-20B 與 Qwen3-30B-A3B-Thinking-2507)的 3.3 倍。它依 NVIDIA Nemotron Open Model License 發布,並明確獲准用於商業用途。

有個較小的同系列成員值得了解,因為傳聞名稱中的「3B」與它相當接近:Nemotron-3 Nano 4B 是透過 NVIDIA 的 Elastic 框架,從 NVIDIA-Nemotron-Nano-9B-v2 壓縮而來,它「主要由 Mamba-2 與 MLP 層組成,只結合四層 Attention。」所以 Nano 等級本來就是這個家族中被擠壓、重新裁切的部分。這就是 3B 實驗性變體之所以可能存在的最合理單一原因。

有兩處不一致值得指出,而非粉飾帶過。首先,在已出貨的產品系列中,是大型層級——Nemotron-3 Super 120B-A12B 與 Nemotron-3 Ultra 550B-A55B——採用潛在 MoE;Nano 層級則否。因此,「Nano 形狀的潛在 MoE」並非直接移植現有的 NVIDIA 設定,而是兩個層級概念的重新組合,而這正是那種會先出現在研究檢查點、之後才出現在產品中的東西。其次,Nano 系列的 MoE 區塊採用稠密專家路由;轉向潛在路由會改變每個專家層的 FLOP 概況,因此,在設定檔出現之前,3B 這個標籤幾乎無法讓人了解模型實際的服務成本。

移植軌跡是真的——模型則不然

可以驗證的是,Gated DeltaNet-2 正被快速整合進生產執行環境。2026 年 9 月 23 日,OpenXLA 的 Tokamax 儲存庫有一項 pull request,為 TPU 新增了 Gated Delta Net 2 Pallas 核心與運算子,包含橫跨六個輸入的自動微分反向傳播,以及在 Cloud TPU v7x 上的基準測試數據。Flash Linear Attention 自六月底以來便持續搭載融合式 GDN-2 預填充核心——該處的 pull request 回報在 H100 上平均有 2.48 倍的預填充加速,最佳情況達 5.13 倍——並在九月後續的提交中修復了閘門排序錯誤,並最佳化了 chunk 訓練路徑。ONNX 有一個針對它提出的未解決規格缺口,因為 opset 27 的 LinearAttention 運算子無法表達 GDN-2 的逐通道抹除閘門。而 NVIDIA 自家的 Megatron-Bridge 則在三月為混合式 GDN 層與 latent-MoE 壓縮兩者新增了 FLOPs 計算。

這些都不是模型發布,把它解讀成模型發布會是個錯誤。核心(kernel)開發屬於基礎設施;它說明的是某個架構正被認真看待,而不是說已經有檢查點存在。它真正帶給你的,是一個具體可監測的東西:如果 GDN-2 混合架構真的問世,它會先以支援功能落地到服務引擎的形式出現,之後才會有正式公告,而引擎端的支援已經部分就位。Tokamax 與 Flash Linear Attention 的成果,也是最有力的論據,證明那則推文裡的組合在技術上合理、而非憑空捏造——因為打造服務 GDN-2 混合架構所需元件的人,並不是寫那則推文的人。

Screenshot of the NVlabs/GatedDeltaNet-2 GitHub repository page in English: the title 'Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention', the file list with README.md, LICENSE, SECURITY.md and lit_gpt/scripts directories, and the About panel showing 317 stars, 33 forks and a last commit from last month.

為什麼 3B GDN-2 混合模型如果推出會很重要

這種組合的著眼點在於經濟性,而非基準測試驅動。一款具備固定大小遞迴狀態的 3B 級混合模型,是你能在單張消費級 GPU 上執行的模型,而且不需要會隨著提示長度增長的 KV 快取——這正是 Nemotron-3 Nano 4B 已經做出的相同取捨。根據論文數據,把 Mamba-2 層換成 GDN-2,能在相同狀態大小下換得更好的多鍵檢索,以及更好的真實世界檢索平均值——而這正是較舊的 delta-rule 家族最弱的兩個地方。這是針對性的升級,而非跨世代的升級,而這也正是那種值得投入 3B 參數的改變。

這也提醒我們,小型模型中真正有趣的競爭已經從參數量轉向記憶體設計。一個遞迴狀態是固定張量的 3B 模型,在長提示下的行為不同於帶有量化 KV 快取的 3B Transformer:記憶體佔用是固定的,但模型對它能記住什麼有固定預算,而它遺忘得多優雅,現在成了規格。Gated DeltaNet-2 的全部貢獻就是一個更好的遺忘規則。這使它成為一個本身就值得關注的設計,即使 GDN-2-3B 從未以那個名稱出現。

你會如何實際測試這樣的東西?

當一個未經實證的架構進入推論服務執行環境時,對多數團隊而言,障礙不是那張基準測試表——而是採用它意味著新的整合、新的契約和新的失敗模式,而且全都得面對一個沒有正式環境實績的模型。這首先是路由問題,其次才是模型問題。一個把新端點放在你已使用的同一把金鑰後方的聚合器,意味著你可以把一部分真實流量導向它,將現有模型保留為備援,並讓自動容錯移轉在新路由仍不穩定時捕捉錯誤——單一 API 跨 200+ 個模型,以供應商表定價格,0% 加成,因此當初報給你的價格就是你實際支付的價格,而供應商降價當天就會反映,而不是等到下一張帳單。GDN-2-3B 本身並未託管在任何地方,無論是我們或其他人;這就是「未發布」的意思。重點在於,等到它發布的那一天,你會採用的就是這個模式。

如果你想了解目前有哪些混合與長上下文模型可供路由,即時模型目錄才是最誠實的清單——它標示的是實際上可提供服務的模型,而不是已經宣布的內容。

Screenshot of the OrcaRouter model catalogue at orcarouter.ai/models, headline '204 models - 16 providers - one API key, one bill', with the filter rail for input modalities, context length, input price, status and series, the Models / Leaderboard / Offers / playground tabs, and a 'How to call any model' panel.

該注意什麼,以及什麼會否證這一點

這起洩漏會以三種方式之一收場,而每種都有跡象可循:

• 一個設定檔 —— 最強而有力的單一佐證,會是一份 Nemotron-H 風格的設定,以混合覆寫模式列出 GDN-2 層類型。在那樣的 config.json 出現之前,一切都只是從一句話推斷出來的。

• 引擎對特定檢查點的支援——GDN-2 核心已存在;不存在的是任何聲稱能服務具名 GDN-2 混合模型的引擎。這個缺口被填補才是真正的信號。

• 授權條款變更——這點很容易被忽略。Gated DeltaNet-2 參考程式碼採用 NVIDIA Source Code License-NC 發布,該授權屬非商業性,而 Nemotron 模型權重則以 NVIDIA Nemotron Open Model License 發布,後者並非如此。若有一個結合兩者的混合方案,就必須化解這股張力,而它如何化解,將說明結果是研究產物,還是你能實際部署的東西。

有兩件事會推翻這裡的框架。如果名稱中的「3B」到頭來指的不是總參數量——而是活躍參數、某一層,或單純只是個代號——那經濟效益就會完全不同。而如果「latent MoE」這個說法到頭來只是普通的 MoE 區塊,那麼這個概念就比看起來小得多:只是換了不同線性層重新裁切的 Nano,而不是一種新形態。

這引發的問題

Gated DeltaNet-2 與 Qwen3.8 中已有的 Gated DeltaNet 有何不同?

較早的 Gated DeltaNet 對抹除與寫入都使用單一純量閘門;Gated DeltaNet-2 將其拆分為兩個通道級閘門,並加入借鑑自 Kimi Delta Attention 的通道級衰減。因此它是嚴格的推廣,而非替代方案,而實務上的差異會在檢索中顯現,而非困惑度——在多鍵大海撈針任務上的差距,遠比在 WikiText 上的差距大得多。

為什麼會有人把 Mamba-2 換成 GDN-2,而不是直接堆疊更多 Mamba-2 層?

因為在相同的遞迴狀態大小下,論文衡量出 Gated DeltaNet-2 在長上下文代理式工作負載實際會用到的檢索任務上表現領先,代價是吞吐量上一點固定的額外負擔。如果你的工作負載以檢索為主,這樣的取捨是有利的;如果是在短上下文下受吞吐量限制,Mamba-2 基準則是更划算的選擇。一個 3B 測試平台是判斷你的流量比較像哪一種的合理方式。

這些元件的開源狀態是否意味著模型也會開源?

不。Nemotron-3 Nano 的權重是開放的,而 Gated DeltaNet-2 的參考程式碼是公開的,但這兩件事都不強迫任何人發布以它們為基礎建構的檢查點——而且 GDN-2 程式碼的非商業授權意味著商業發布需要不同的安排。可能的結果範圍從在 Nemotron Open Model License 下由 NVIDIA 發布研究版本,到某個永遠不會離開內部叢集的東西。

今天有什麼可以試試的嗎?

是的,但不是 GDN-2-3B。Gated DeltaNet-2 論文的檢查點可從 NVlabs 儲存庫以 1.3B 規模在 FineWeb-Edu 上重現,而 Nemotron-3 Nano 30B-A3B 與 4B 如今已能在 vLLM、SGLang、TensorRT-LLM 和 llama.cpp 上執行。測試任一半,就能得知另一半大概會有什麼表現——這比那則推文所提供的資訊還多。

這些都無法讓 GDN-2-3B 成真。這只是讓 GDN-2-3B 可被否證,而這已是一句話所能提供的最多:距離成為貨真價實的近期發布,或成為聽起來合理、卻永遠不會被做出來的重組,只差一份設定檔、一個引擎宣稱,或一個程式碼儲存庫。