ヒーロータイトルカードは「GDN-2-3B」を大見出しに、サブタイトルは「Mamba-2 を Gated DeltaNet-2 に差し替えた Nemotron-3 Nano ハイブリッド — ツイート1件のみ、重みなし」。3つのステータスチップは「未リリース」「単一情報源」「ベンチマークなし」、フッター行は「2026-09-26 の X 投稿1件で名前が挙がった未検証のリリース候補。」右下に OrcaRouter のロゴ。
Guides & Insights

GDN-2-3Bリーク:Mamba-2の代わりにGated DeltaNet-2を搭載したNemotron-3 Nanoハイブリッド

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2026年9月26日にXに投稿されたたった一文が、これまでのGDN-2-3Bに関する公開記録のすべてである。アカウント@teortaxesTexは、「近い将来のリリース候補の一つはハイブリッドGDN-2-3B潜在MoEで、これはNemotron-3 Nanoアーキテクチャに従うが、Mamba-2層をGDN-2に置き換える」と書いた。それだけだ——Hugging Faceリポジトリも、設定ファイルも、パラメータ表も、名前の挙がった構築者も、日付もない。GDN-2-3Bはリリースされておらず、以下の記述は、それがリリース済みであるかのように読まれるべきではない。それでもこの一文を掘り下げる価値があるのは、その前半と後半がどちらも、実在し検証可能な何かを名指ししているからだ。Gated DeltaNet-2は、NVIDIAが公開した線形アテンションアーキテクチャで、公開されたPyTorch実装があり、TPU、Triton、ONNXツール群を通じた活発な移植の足跡もあり、Nemotron-3 Nanoは、うわさのモデルが接ぎ木されている、NVIDIAが出荷済みのオープンウェイトMamba-2ハイブリッドである。これは現時点で分かっていることをまとめた記事だ。アーキテクチャは文書化されており、モデルはうわさであり、その二つの違いこそが話のすべてである。

要約すると、Gated DeltaNet-2 は、線形アテンションモデルが編集するその圧縮メモリの扱いを変える。そしてその測定された利得は、小型ハイブリッドが買われるまさにその長文脈検索作業で最も強く効く。Nemotron-3 Nano は NVIDIA の現在のハイブリッドファミリーで最小のティアであり、より安価なリカレンスで再設計される可能性が最も高い。これらを組み合わせると、もっともらしいリリース候補が生まれ、そしてそう言っているのは正確に一人だけだ。

ツイートが述べていることと述べていないこと

この文を注意深く読んでください。なぜなら、それは異常に濃密でありながら、同時に異常に薄いからです。この文は、候補がハイブリッド(つまり、複数の層タイプ)で、3B(1 台のコンシューマー GPU で実行できるほど小さいパラメータ数)であり、潜在 MoE(トークンがエキスパートに到達する前に、より小さな潜在次元に投影される NVIDIA のエキスパートルーティング設計であり、Super 120B と Ultra 550B ティアが採用しているもので、出荷済みの Nano ティアが採用していないものです)であると述べています。層パターンは Nemotron-3 Nano に従っていると述べています。また、Mamba-2 層は GDN-2 に置き換えられていると述べています。

書かれていないのは、誰がそれを作っているのかということだ。「近く登場するリリース候補の1つ」には主語がない。そこにNVIDIAを読み込みたくなる——GDN-2はNVIDIAの研究であり、Nemotron-3 NanoはNVIDIAのモデルなので、この組み合わせは自社実験のように見える——が、ツイートはそう述べておらず、第三者が今日、合法的にこの2つを組み合わせることは可能だ。Nemotron-3 Nanoの重みはオープンで、Gated DeltaNet-2の参照コードは公開されているからである。作成者は不明として扱うこと。

いつなのかも述べていない。「近い将来」が唯一の時期を示す手がかりだが、それは日付ではない。ダウンロードできるチェックポイントも、それを提供すると主張する推論エンジンも、モデルそのもののベンチマークもどこにも存在しない。本記事のすべての数値は、別々に公開された Gated DeltaNet-2 または Nemotron-3 Nano に属する。それらのいずれも GDN-2-3B に属するものではない。

名前の二つの半分、そしてそれがなぜ合うのか

Gated DeltaNet-2を1分で

線形アテンションは、softmaxアテンションの無制限のKVキャッシュを、固定サイズの再帰状態に置き換える。難しいのは、何を忘れるかを決めることではない — すでにそこに保存されている連想をかき乱すことなく、その状態を編集することだ。デルタルールモデルは、新しい値を書き込む前に現在の読み取り値を差し引く。Kimi Delta Attentionは、チャネルごとの減衰によって忘却を鋭くした。しかし、どちらも依然として、1つのスカラーゲートから2つの異なる決定を駆動している:キー側でどれだけ古い内容を消去するか、そしてバリュー側でどれだけ新しい内容をコミットするか。

NVIDIAの研究者Ali Hatamizadeh、Yejin Choi、Jan Kautzによって発表されたGated DeltaNet-2(arXiv 2605.22791、参照コードはNVlabsリポジトリ)は、そのスカラーをチャネル単位の2つのゲート——キー側の座標に対する消去ゲートと、値側の座標に対する書き込みゲート——に分割し、チャネル単位の減衰はそのまま維持する。論文の位置づけによれば、この設計はそれ以前のものを厳密に一般化したものである。両方のゲートを同一のスカラーに潰せば、Kimi Delta Attentionが得られる。さらに減衰も潰せば、以前のGated DeltaNetが得られる。アブレーション実験において、NVIDIAは消去ゲートが利得の大部分を占めると報告しており、これはキー側の連想が上書きされるのを防ぐというその役割と符合する。

その根拠は製品ではなく、パラメータを揃えた研究だ:すべてのモデルは1.3Bパラメータで100BのFineWeb-Eduトークンを用いて学習され、再帰状態サイズはMamba-2、Gated DeltaNet、KDA、Mamba-3の間で等しく固定されている。再帰設定では、Gated DeltaNet-2がグループ最高のWikiTextパープレキシティ15.90を記録し、Mamba-2の16.79を上回る。また、平均常識推論精度も53.11で最高となり、Mamba-3の52.39を上回る。ハイブリッド設定——実際にNemotron-3 Nanoのインターリーブパターンに似ているのはこちら——では、WikiTextパープレキシティ15.62、平均精度53.97で、Mamba-3(15.81 / 52.72)を上回り、通常のTransformerベースライン(19.22 / 50.86)を大きく上回る。

優位性がどこに集中しているかが、小規模な長文脈モデルにとって重要な点だ。RULERの再帰型マルチキーneedle-in-a-haystackテストの4Kでは、Gated DeltaNet-2は37.8を記録し、旧来のGated DeltaNetは27.8、KDAは28.0だった。2Kでのシングルニードルでは89.8対54.2となる。6つの実検索データセット(SWDE、SQuAD、FDA、TriviaQA、NQ、DROP)で平均すると、再帰型のフロンティアでは29.88でMamba-2の26.84を上回り、ハイブリッドのフロンティアでは42.28でKDAの40.14を上回る。NVIDIAはまた、単一のH100上でシーケンス長に対するスループットのスケーリングがほぼ平坦であり、追加のゲートによるKDAに対する小さな一定のオーバーヘッドしかないと報告している。これらは論文自身の表にあるベンダー公表値であり、当方では再現していない。

Two-column comparison scoreboard titled 'Mamba-2 vs Gated DeltaNet-2 - the scoreboard'. Left column 'Mamba-2': Decay scalar; Erase gate none; Write gate scalar; WikiText ppl 16.79; LMB ppl 12.38; Retrieval avg 26.84. Right column 'Gated DeltaNet-2': Decay channel-wise; Erase gate channel-wise b; Write gate channel-wise w; WikiText ppl 15.90; LMB ppl 11.41; Retrieval avg 29.88. Footer: both recurrent-only, 1.3B params, 100B FineWeb-Edu tokens, figures per NVIDIA's Gated DeltaNet-2 paper, not independently reproduced. OrcaRouter logo bottom-right.

Nemotron-3 Nanoのブループリント

Nemotron-3 NanoはMixture-of-ExpertsのハイブリッドMamba-Transformerであり、借用されているのはモデルではなくアーキテクチャだ。30B-A3Bリリースは52層で、内訳はMamba-2層が23、MoE層が23、grouped-query attention層が6であり、各MoEブロックに128のrouted expertと1つの共有expert、トークンあたり6つのexpertがアクティブになる。総パラメータ30Bに対してアクティブパラメータ3.5Bを備え、25兆トークンで事前学習され、最大1Mトークンのコンテキストウィンドウをサポートする。NVIDIA自身の技術レポートでは、GPT-OSS-20BやQwen3-30B-A3B-Thinking-2507などの同規模のオープンモデルと比べて最大3.3倍高い推論スループットを主張している。NVIDIA Nemotron Open Model Licenseの下でリリースされ、商用利用が明示的に認められている。

知っておく価値のある、より小型の兄弟分が存在する。というのも、噂の名称にある「3B」はそれに近い値になるからだ。Nemotron-3 Nano 4B は、NVIDIA-Nemotron-Nano-9B-v2 から NVIDIA の Elastic フレームワークを使って圧縮されたもので、「主に Mamba-2 と MLP 層に、わずか 4 つの Attention 層を組み合わせたもの」である。つまり Nano ティアはすでに、このファミリーの中で圧縮され、切り直される部分なのだ。3B の実験的バリアントがそもそも存在するとしたら、その最も有力な理由はこれである。

2つの不一致は、丸め込むのではなく指摘する価値がある。第一に、出荷済みのファミリーで潜在MoEを使っているのは大規模ティア — Nemotron-3 Super 120B-A12B と Nemotron-3 Ultra 550B-A55B — であり、Nanoティアはそうではない。したがって「Nano型の潜在MoE」は、既存のNVIDIA構成をそのまま移植したものではなく、2つのティアのアイデアを組み合わせ直したものであり、まさに研究用チェックポイントに製品より先に現れる類のものだ。第二に、NanoファミリーのMoEブロックは密エキスパートルーティングであり、潜在ルーティングに移行すればすべてのエキスパート層のFLOPプロファイルが変わるため、3Bというラベルだけでは、構成ファイルが現れるまで、そのモデルを実際に提供するコストがどれほどかについてほとんど何も分からない。

移植の痕跡は本物だ — モデルは本物ではない

検証できるのは、Gated DeltaNet-2 が急速に本番ランタイムへ組み込まれつつあるということだ。2026年9月23日、OpenXLA の Tokamax リポジトリへのプルリクエストで、TPU 向けの Gated Delta Net 2 Pallas カーネルとオペレータが追加された。これには6つの入力にわたる autograd バックワードパスと、Cloud TPU v7x 上でのベンチマーク数値が含まれる。Flash Linear Attention は6月下旬以降、融合 GDN-2 prefill カーネルを搭載しており、そこのプルリクエストは H100 上で平均2.48倍の prefill 高速化、最良ケースで5.13倍を報告している。9月のフォローアップでは、ゲート順序のバグを修正し、チャンク学習パスを最適化した。ONNX には、これに対する未解決の仕様ギャップが起票されている。opset 27 の LinearAttention オペレータが GDN-2 のチャネル単位の erase gate を表現できないからだ。そして NVIDIA 自身の Megatron-Bridge は、3月にハイブリッド GDN 層と latent-MoE 圧縮の両方を対象とした FLOPs 計算を追加した。

それらのどれもモデルリリースではなく、それをモデルリリースとして読むのは誤りだ。カーネル関連の作業はインフラであり、あるアーキテクチャが真剣に受け止められていることを示すのであって、チェックポイントが存在することを示すものではない。それが与えてくれるのは、監視すべき具体的なものだ。もしGDN-2ハイブリッドが実際に世に出るなら、それはまずサービングエンジンにサポートが入る形で現れ、発表はそのあとになる。そして、そのエンジンサポートはすでに一部整っている。TokamaxとFlash Linear Attentionの取り組みもまた、そのツイートにおける組み合わせがでっち上げではなく技術的に筋が通っているという最も強い根拠だ——GDN-2ハイブリッドをサービングするために必要な部品は、そのツイートを書いた人物ではない人々によって作られている。

Screenshot of the NVlabs/GatedDeltaNet-2 GitHub repository page in English: the title 'Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention', the file list with README.md, LICENSE, SECURITY.md and lit_gpt/scripts directories, and the About panel showing 317 stars, 33 forks and a last commit from last month.

3B GDN-2ハイブリッドが出荷されるなら、それが重要なのはなぜか

この組み合わせを選ぶ根拠は、ベンチマーク主導というより経済性にある。固定サイズの再帰状態を持つ3Bクラスのハイブリッドは、プロンプトとともに増大するKVキャッシュなしで、1台のコンシューマー向けGPUで実行できるモデルであり、これはNemotron-3 Nano 4Bがすでに成立させているのと同じ取引だ。Mamba-2層をGDN-2に置き換えることで、論文の数値上は、同じ状態サイズでより優れたマルチキー検索と、より優れた実世界検索平均が得られる——旧来のデルタルール系が最も弱かった2点である。これは世代的なアップグレードではなく、的を絞ったアップグレードであり、3Bのパラメータに値する種類の変更だ。

これはまた、小規模モデルにおける興味深い競争が、パラメータ数からメモリ設計へと移ったことを思い起こさせる。再帰状態が固定テンソルである3Bモデルは、量子化されたKVキャッシュを備えた3Bトランスフォーマーとは、長いプロンプト下で異なる振る舞いをする。メモリは一定だが、モデルが記憶できるものには固定の予算があり、どれだけ優雅に忘却するかが今や仕様である。Gated DeltaNet-2の貢献のすべては、より優れた忘却規則にある。そのため、たとえGDN-2-3Bがその名前で決して登場しなくても、これはそれ自体として注目に値する設計である。

こういうものを実際にどうテストするか

実績のないアーキテクチャがサービングランタイムに届いたとき、多くのチームにとっての障壁はベンチマークの表ではない。導入するということは、新しい統合、新しい契約、そして新しい障害モードを意味し、しかもそれは本番運用の実績がまったくないモデルに対して行われるのだ。これはモデルの問題である前に、まずルーティングの問題である。すでに使っているのと同じキーの裏に新しいエンドポイントを置くアグリゲーターなら、実際のトラフィックの一部をそこに流し、既存のモデルをフォールバックとして残しておき、自動フェイルオーバーに、新しいルートがまだ不安定なうちはエラーを拾わせておける — 200以上のモデルにわたる1つのAPIをプロバイダーの定価で、マークアップ0%で利用できる。つまり、提示された価格がそのまま支払う価格であり、ベンダーの値下げは次の請求書ではなくその日のうちに反映される。GDN-2-3B自体は、当社によっても他の誰によっても、どこにもホストされていない。それが「未リリース」という意味だ。大事なのは、いざそれが登場した日にあなたが使うことになるパターンのほうだ。

今日どのハイブリッドモデルと長コンテキストモデルがルーティング可能かを確認したいなら、ライブモデルカタログが正直なリストです — 発表されたものではなく、実際に提供可能なものが示されています。

Screenshot of the OrcaRouter model catalogue at orcarouter.ai/models, headline '204 models - 16 providers - one API key, one bill', with the filter rail for input modalities, context length, input price, status and series, the Models / Leaderboard / Offers / playground tabs, and a 'How to call any model' panel.

注視すべき点、そしてこれを反証するものは何か

漏れは3通りのいずれかで解消し、それぞれに兆候がある:

• 設定ファイル — 単一で最も強力な確認となるのは、GDN-2レイヤータイプをハイブリッドオーバーライドパターンで列挙したNemotron-H形式の構成でしょう。そのようなconfig.jsonが存在するまでは、すべては一文からの推測です。

• 特定のチェックポイントに対するエンジンサポート — GDN-2カーネルはすでに存在する。存在しないのは、名前付きのGDN-2ハイブリッドを提供すると主張するエンジンだ。そのギャップが埋まることこそが本当のシグナルである。

• ライセンスの変更 — これは見落としやすい。Gated DeltaNet-2 の参照コードは非商用の NVIDIA Source Code License-NC の下で公開されている一方、Nemotron のモデル重みは非商用ではない NVIDIA Nemotron Open Model License の下で提供されている。両者を組み合わせたハイブリッドは、この緊張関係を解決しなければならず、その解決の仕方が、その成果物が研究用のものなのか、それともデプロイ可能なものなのかを教えてくれる。

ここでの枠組みを反証することになる事柄が2つある。名称の「3B」が総パラメータ以外の何か — アクティブパラメータ、層数、あるいは単なるコードネーム — を意味することが判明すれば、経済性は一変する。そして「latent MoE」という表現が単なるMoEブロックを指すことが判明すれば、これは見かけよりずっと小さいアイデアだ。異なる線形層を備えたNanoの再カットであり、新しい形ではない。

これが提起する疑問

Gated DeltaNet-2は、すでにQwen3.8に組み込まれているGated DeltaNetとどう異なるのですか?

以前のGated DeltaNetは消去と書き込みの両方に単一のスカラーゲートを使っていた。Gated DeltaNet-2はそれを2つのチャネル単位のゲートに分割し、Kimi Delta Attentionから借用したチャネル単位の減衰を追加している。したがってそれは置き換えではなく厳密な一般化であり、実用的な違いはパープレキシティではなく検索に現れる——マルチキーneedle-in-a-haystackにおける差は、WikiTextにおける差よりもはるかに大きい。

なぜ単にMamba-2のレイヤーを増やして投入するのではなく、わざわざMamba-2をGDN-2に置き換えるのか?

というのは、同一の再帰状態サイズにおいて、論文では Gated DeltaNet-2 が、長コンテキストのエージェントワークロードが実際に行使する検索タスクで優位であると測定されており、その代償はスループットにおける小さな一定のオーバーヘッドだからである。あなたのワークロードが検索負荷の高いものであれば、そのトレードオフは有利であり、短いコンテキストでスループット律速であるなら、Mamba-2 ベースラインのほうが安価な答えである。3B のテストベッドは、あなたのトラフィックがどちらに似ているかを見極めるための賢明な方法である。

部品がオープンソースであるということは、モデルもオープンになるということでしょうか。

いいえ。Nemotron-3 Nanoの重みはオープンで、Gated DeltaNet-2の参照コードは公開されているが、どちらの事実も、それらから構築されたチェックポイントを公開することを誰かに義務づけるものではない——そしてGDN-2コードの非商用ライセンスは、商用リリースには別の取り決めが必要になることを意味する。考えられる結果は、Nemotron Open Model Licenseの下でのNVIDIAの研究リリースから、内部クラスタから決して出ないものまで幅がある。

今日は何か試せるものはありますか?

はい、ただしGDN-2-3Bではありません。Gated DeltaNet-2論文のチェックポイントは、NVlabsリポジトリからFineWeb-Edu上の1.3Bで再現可能であり、Nemotron-3 Nano 30B-A3Bと4Bは今日vLLM、SGLang、TensorRT-LLM、llama.cppで動作します。どちらか一方をテストすれば、もう一方がおそらくどうなるかがわかります——これはそのツイートから得られる以上のものです。

こうしたことはどれも、GDN-2-3Bを実在のものにはしない。それはGDN-2-3Bを反証可能にする。一文ができるのはせいぜいそれだけだ。あとは設定ファイルが1つ、エンジンに関する主張が1つ、あるいはリポジトリが1つあれば、本物の近未来リリースなのか、決して作られないもっともらしく聞こえる再結合なのかが判明する。