Carte de titre principale intitulée « GDN-2-3B » avec le sous-titre « Un hybride Nemotron-3 Nano avec Mamba-2 remplacé par Gated DeltaNet-2 - un tweet, pas de poids », trois pastilles de statut affichant « non publié », « source unique » et « aucun benchmark », et une ligne de pied de page « Candidat de version non vérifié nommé dans un seul post X le 2026-09-26. » Logo OrcaRouter en bas à droite.
Guides & Insights

Fuite de GDN-2-3B : un hybride Nemotron-3 Nano avec Gated DeltaNet-2 à la place de Mamba-2

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Une seule phrase publiée sur X le 26 septembre 2026 constitue l'intégralité des informations publiques disponibles sur GDN-2-3B à ce jour. Le compte @teortaxesTex a écrit qu'« un candidat à une sortie à court terme est le MoE latent hybride GDN-2-3B, qui suit l'architecture Nemotron-3 Nano mais remplace les couches Mamba-2 par GDN-2 ». Voilà, c'est tout : pas de dépôt Hugging Face, pas de fichier de configuration, pas de tableau de paramètres, pas de constructeur nommé, pas de date. GDN-2-3B n'a pas été publié, et rien de ce qui suit ne doit être lu comme s'il l'avait été. Ce qui rend néanmoins cette phrase digne d'être décortiquée, c'est que ses deux moitiés désignent quelque chose de réel et de vérifiable : Gated DeltaNet-2 est une architecture d'attention linéaire publiée par NVIDIA, dotée d'une implémentation PyTorch publique et d'un dense parcours de portage à travers l'outillage TPU, Triton et ONNX, et Nemotron-3 Nano est l'hybride Mamba-2 à poids ouverts commercialisé par NVIDIA, sur lequel le modèle rumeur viendrait se greffer. Il s'agit d'un article « ce que nous savons à ce stade » : l'architecture est documentée, le modèle est une rumeur, et la différence entre ces deux choses, c'est toute l'histoire.

La version courte : Gated DeltaNet-2 change la façon dont un modèle d'attention linéaire modifie sa mémoire compressée, et ses gains mesurés se font le plus sentir précisément sur le travail de récupération en contexte long pour lequel on achète un petit hybride. Nemotron-3 Nano est le plus petit échelon de la famille hybride actuelle de NVIDIA et celui qui a le plus de chances d'être redécoupé avec une récurrence moins coûteuse. Rassemblez ces éléments et vous obtenez un candidat de version plausible — et précisément une personne pour le dire.

Ce que le tweet dit et ne dit pas

Lisez attentivement la phrase, car elle est à la fois inhabituellement dense et inhabituellement mince. Elle indique que le candidat est hybride (donc, plus d’un type de couche), 3B (un nombre de paramètres assez petit pour tourner sur un seul GPU grand public), et un MoE latent (une conception de routage d’experts NVIDIA dans laquelle les tokens sont projetés dans une dimension latente plus petite avant d’atteindre les experts, ce que les paliers Super 120B et Ultra 550B utilisent et ce que le palier Nano livré n’utilise pas). Elle indique que le schéma de couches suit Nemotron-3 Nano. Et elle indique que les couches Mamba-2 sont remplacées par GDN-2.

Ce qu’il ne dit pas : qui le construit. « Une version candidate à court terme » n’a pas de sujet. Il est tentant d’y voir NVIDIA — GDN-2 est une recherche NVIDIA et Nemotron-3 Nano est un modèle NVIDIA, donc l’association ressemble à une expérience maison —, mais le tweet ne dit pas cela, et un tiers peut légalement combiner les deux aujourd’hui, car les poids de Nemotron-3 Nano sont ouverts et le code de référence de Gated DeltaNet-2 est public. Considérez le constructeur comme inconnu.

Il ne dit pas non plus quand. « À court terme » est le seul indice temporel, et ce n’est pas une date. Il n’y a aucun checkpoint à télécharger, aucun moteur d’inférence qui prétende le servir, et aucun benchmark du modèle lui-même, où que ce soit. Chaque chiffre de cet article appartient à Gated DeltaNet-2 ou à Nemotron-3 Nano tels que publiés séparément. Aucun d’entre eux n’appartient à GDN-2-3B.

Les deux moitiés du nom, et pourquoi elles vont ensemble

Gated DeltaNet-2 en une minute

L’attention linéaire remplace le cache KV non borné de l’attention softmax par un état récurrent de taille fixe. La difficulté ne consiste pas à décider ce qu’il faut oublier — mais à modifier cet état sans brouiller les associations qui y sont déjà stockées. Les modèles à règle delta soustraient la lecture courante avant d’écrire une nouvelle valeur ; Kimi Delta Attention a affiné l’oubli grâce à une décroissance par canal. Toutefois, tous deux continuent de piloter deux décisions différentes à partir d’une seule porte scalaire : quelle quantité d’ancien contenu effacer du côté des clés, et quelle quantité de nouveau contenu inscrire du côté des valeurs.

Gated DeltaNet-2, publié par les chercheurs de NVIDIA Ali Hatamizadeh, Yejin Choi et Jan Kautz (arXiv 2605.22791, code de référence dans le dépôt NVlabs), scinde ce scalaire en deux portes par canal — une porte d'effacement sur les coordonnées du côté clé et une porte d'écriture sur les coordonnées du côté valeur — et conserve le déclin par canal. Le cadre conceptuel de l'article est que cette conception généralise strictement ce qui existait auparavant : ramenez les deux portes au même scalaire et vous retrouvez Kimi Delta Attention ; ramenez également le déclin à un scalaire et vous retrouvez le Gated DeltaNet antérieur. En ablation, NVIDIA rapporte que la porte d'effacement est responsable de la majeure partie du gain, ce qui correspond à son rôle dans la protection des associations du côté clé contre l'écrasement.

Les données probantes proviennent d’une étude à paramètres appariés, et non d’un produit : chaque modèle a été entraîné avec 1,3 milliard de paramètres sur 100 milliards de tokens FineWeb-Edu, la taille de l’état récurrent étant maintenue identique pour Mamba-2, Gated DeltaNet, KDA et Mamba-3. Dans le cadre récurrent, Gated DeltaNet-2 affiche la meilleure perplexité WikiText du groupe, à 15,90, contre 16,79 pour Mamba-2, ainsi que la meilleure précision moyenne en sens commun, à 53,11, contre 52,39 pour Mamba-3. Dans le cadre hybride — celui qui ressemble réellement au schéma entrelacé de Nemotron-3 Nano —, il affiche une perplexité WikiText de 15,62 et une précision moyenne de 53,97, devant Mamba-3 (15,81 / 52,72) et loin devant une simple ligne de base Transformer (19,22 / 50,86).

Là où l'avantage se concentre est la partie qui compte pour un petit modèle à long contexte. Sur le test de recherche d'aiguille dans une botte de foin à clés multiples récurrent de RULER à 4K, Gated DeltaNet-2 obtient 37,8 contre 27,8 pour l'ancien Gated DeltaNet et 28,0 pour KDA ; sur aiguille unique à 2K, il obtient 89,8 contre 54,2. En moyenne sur six ensembles de récupération réels (SWDE, SQuAD, FDA, TriviaQA, NQ, DROP), il mène la frontière récurrente à 29,88 contre 26,84 pour Mamba-2, et la frontière hybride à 42,28 contre 40,14 pour KDA. NVIDIA rapporte également une mise à l'échelle du débit quasi plate avec la longueur de séquence sur un seul H100, avec seulement un petit surcoût constant par rapport à KDA pour les portes supplémentaires. Ce sont des chiffres du fournisseur issus des propres tableaux de l'article, non reproduits par nous.

Two-column comparison scoreboard titled 'Mamba-2 vs Gated DeltaNet-2 - the scoreboard'. Left column 'Mamba-2': Decay scalar; Erase gate none; Write gate scalar; WikiText ppl 16.79; LMB ppl 12.38; Retrieval avg 26.84. Right column 'Gated DeltaNet-2': Decay channel-wise; Erase gate channel-wise b; Write gate channel-wise w; WikiText ppl 15.90; LMB ppl 11.41; Retrieval avg 29.88. Footer: both recurrent-only, 1.3B params, 100B FineWeb-Edu tokens, figures per NVIDIA's Gated DeltaNet-2 paper, not independently reproduced. OrcaRouter logo bottom-right.

Le blueprint Nemotron-3 Nano

Nemotron-3 Nano est un hybride Mamba-Transformer de type mélange d'experts (MoE), et c'est l'architecture qui est empruntée plutôt que le modèle. La version 30B-A3B compte 52 couches : 23 couches Mamba-2, 23 couches MoE et six couches d'attention à requêtes groupées, avec 128 experts routés plus un expert partagé par bloc MoE et six experts actifs par token. Il compte 3,5B de paramètres actifs contre 30B au total, a été préentraîné sur 25 000 milliards de tokens et prend en charge des fenêtres de contexte allant jusqu'à 1 million de tokens ; le rapport technique de NVIDIA lui-même revendique un débit d'inférence jusqu'à 3,3 fois supérieur à celui de modèles ouverts de taille similaire tels que GPT-OSS-20B et Qwen3-30B-A3B-Thinking-2507. Il est publié sous la licence NVIDIA Nemotron Open Model et est explicitement autorisé pour un usage commercial.

Il y a un petit frère encore plus petit qu'il vaut la peine de connaître, car le « 3B » du nom pressenti s'en rapproche : Nemotron-3 Nano 4B, compressé à partir de NVIDIA-Nemotron-Nano-9B-v2 à l'aide du framework Elastic de NVIDIA, est « principalement composé de couches Mamba-2 et MLP, combinées à seulement quatre couches d'attention ». Ainsi, le niveau Nano est déjà la partie de la famille qui se fait comprimer et redécouper. C'est la raison la plus plausible pour laquelle une variante expérimentale 3B existerait tout court.

Deux incohérences méritent d’être signalées plutôt que lissées. Premièrement, dans la famille livrée, ce sont les grands paliers — Nemotron-3 Super 120B-A12B et Nemotron-3 Ultra 550B-A55B — qui utilisent un MoE latent ; ce n’est pas le cas du palier Nano. Un « MoE latent de forme Nano » n’est donc pas un portage direct d’une configuration NVIDIA existante, mais une recombinaison des idées de deux paliers, exactement le genre de chose qui apparaît dans des checkpoints de recherche avant d’apparaître dans un produit. Deuxièmement, les blocs MoE de la famille Nano sont routés vers des experts denses ; passer à un routage latent modifie le profil FLOP de chaque couche d’experts, donc une étiquette 3B vous en dirait très peu sur ce que le modèle coûte réellement à servir tant qu’un fichier de configuration n’apparaît pas.

La piste de portage est réelle — le modèle ne l'est pas

Ce qui est vérifiable, c'est que Gated DeltaNet-2 est en cours d'intégration rapide dans les environnements d'exécution de production. Le 23 septembre 2026, une pull request adressée au dépôt Tokamax d'OpenXLA a ajouté un noyau et un opérateur Pallas Gated Delta Net 2 pour TPU, incluant une passe arrière autograd sur six entrées et des chiffres de benchmark sur Cloud TPU v7x. Flash Linear Attention embarque des noyaux de préremplissage GDN-2 fusionnés depuis fin juin — la pull request correspondante fait état d'une accélération moyenne du préremplissage de 2,48× et d'un meilleur cas de 5,13× sur un H100 — avec des suites en septembre corrigeant un bug d'ordre des portes et optimisant le chemin d'entraînement par chunks. ONNX fait l'objet d'une lacune de spécification ouverte, car l'opérateur LinearAttention de l'opset 27 ne peut pas exprimer la porte d'effacement canal par canal de GDN-2. Et le Megatron-Bridge de NVIDIA lui-même a ajouté en mars une comptabilisation des FLOPs pour les couches GDN hybrides et la compression latent-MoE.

Rien de tout cela n'est une publication de modèle, et ce serait une erreur de l'interpréter comme telle. Le travail sur les noyaux est de l'infrastructure ; cela indique qu'une architecture est prise au sérieux, pas qu'un checkpoint existe. Ce que cela vous donne, en revanche, c'est un élément concret à surveiller : si un hybride GDN-2 voit le jour, il arrivera d'abord sous la forme d'un support intégré à un moteur de service, et ensuite sous la forme d'une annonce, et le support du moteur est déjà partiellement en place. Le travail sur Tokamax et Flash Linear Attention est aussi l'argument le plus solide que l'association dans le tweet est techniquement cohérente plutôt qu'inventée — les pièces nécessaires pour servir un hybride GDN-2 sont construites par des personnes qui ne sont pas l'auteur du tweet.

Screenshot of the NVlabs/GatedDeltaNet-2 GitHub repository page in English: the title 'Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention', the file list with README.md, LICENSE, SECURITY.md and lit_gpt/scripts directories, and the About panel showing 317 stars, 33 forks and a last commit from last month.

Pourquoi un hybride 3B GDN-2 compterait s’il était commercialisé

L'argument en faveur de cette combinaison est économique plutôt que guidé par les benchmarks. Un hybride de classe 3B doté d'un état récurrent de taille fixe est un modèle que l'on peut exécuter sur un seul GPU grand public sans cache KV qui grandit avec le prompt, ce qui est le même compromis que Nemotron-3 Nano 4B accepte déjà. Remplacer les couches Mamba-2 par GDN-2 apporte, d'après les chiffres de l'article, une meilleure récupération multi-clés et de meilleures moyennes de récupération en conditions réelles à taille d'état égale — les deux points où l'ancienne famille à règle delta était la plus faible. Il s'agit d'une mise à niveau ciblée, non d'une mise à niveau générationnelle, et c'est le genre de changement qui vaudrait 3B de paramètres.

C’est aussi un rappel que la compétition intéressante dans les petits modèles est passée du nombre de paramètres à la conception de la mémoire. Un modèle 3B dont l’état récurrent est un tenseur fixe se comporte différemment face à de longs prompts qu’un transformer 3B doté d’un cache KV quantifié : la mémoire est plate, mais le modèle dispose d’un budget fixe pour ce qu’il peut mémoriser, et la manière dont il oublie avec élégance constitue désormais la spécification. Toute la contribution de Gated DeltaNet-2 est une meilleure règle d’oubli. Cela en fait une conception qui mérite d’être suivie pour ses propres mérites, même si GDN-2-3B n’apparaît jamais sous ce nom.

Comment testeriez-vous réellement quelque chose comme ça

Quand une architecture non éprouvée arrive dans un runtime de service, l’obstacle pour la plupart des équipes n’est pas le tableau des benchmarks — c’est que l’adopter implique une nouvelle intégration, un nouveau contrat et un nouveau mode de défaillance, le tout face à un modèle sans historique de production. C’est un problème de routage avant d’être un problème de modèle. Un agrégateur qui met un nouveau point de terminaison derrière la même clé que vous utilisez déjà vous permet d’y envoyer une partie du trafic réel, de conserver votre modèle existant comme solution de repli, et de laisser le basculement automatique intercepter les erreurs pendant que la nouvelle route est encore instable — une seule API pour plus de 200 modèles au prix catalogue du fournisseur avec 0 % de marge, donc le prix qui vous a été annoncé est celui que vous payez et une baisse du fournisseur apparaît le jour même plutôt qu’à la prochaine facture. GDN-2-3B lui-même n’est hébergé nulle part, ni par nous ni par personne d’autre ; c’est ce que signifie « non publié ». L’important, c’est le schéma que vous utiliseriez le jour où il le sera.

Si vous voulez voir quels modèles hybrides et à long contexte sont routables aujourd'hui, le catalogue de modèles en direct est la liste honnête — il indique ce qui est réellement servable plutôt que ce qui a été annoncé.

Screenshot of the OrcaRouter model catalogue at orcarouter.ai/models, headline '204 models - 16 providers - one API key, one bill', with the filter rail for input modalities, context length, input price, status and series, the Models / Leaderboard / Offers / playground tabs, and a 'How to call any model' panel.

Ce qu'il faut surveiller, et ce qui invaliderait cela.

La fuite se résout de l’une de trois manières, et chacune a un signe révélateur :

• Un fichier de configuration — la confirmation la plus forte serait une configuration de style Nemotron-H énumérant les types de couches GDN-2 dans un schéma de surcharge hybride. Tant qu'un config.json de ce type n'existe pas, tout n'est qu'inférence à partir d'une phrase.

• Prise en charge par le moteur d’un checkpoint spécifique — Les kernels GDN-2 existent déjà ; ce qui n’existe pas, c’est un moteur qui prétend servir un hybride GDN-2 nommé. La fermeture de cet écart est le vrai signal.

• Un changement de licence — celui-ci est facile à manquer. Le code de référence Gated DeltaNet-2 est publié sous la licence NVIDIA Source Code License-NC, qui est non commerciale, tandis que les poids du modèle Nemotron sont distribués sous la licence NVIDIA Nemotron Open Model License, qui ne l'est pas. Un hybride combinant les deux devrait résoudre cette tension, et la manière dont il la résout vous indique s'il s'agit d'un artefact de recherche ou de quelque chose que vous pourriez déployer.

Deux choses invalideraient le cadrage présenté ici. Si le « 3B » du nom s'avère désigner autre chose que le nombre total de paramètres — des paramètres actifs, un nombre de couches, ou simplement un nom de code —, l'économie change du tout au tout. Et si l'expression « latent MoE » s'avère décrire un simple bloc MoE, alors l'idée est bien plus modeste qu'elle n'en a l'air : un Nano redécoupé avec une couche linéaire différente, et non une nouvelle forme.

Questions que cela soulève

En quoi Gated DeltaNet-2 diffère-t-il du Gated DeltaNet déjà intégré à Qwen3.8 ?

Le Gated DeltaNet précédent utilise une seule porte scalaire à la fois pour l’effacement et l’écriture ; Gated DeltaNet-2 la scinde en deux portes par canal et ajoute une décroissance par canal empruntée à Kimi Delta Attention. Il s’agit donc d’une généralisation stricte plutôt que d’un remplacement, et la différence pratique se manifeste dans le retrieval, et non dans la perplexité — l’écart sur multi-key needle-in-a-haystack est bien plus large que l’écart sur WikiText.

Pourquoi remplacerait-on Mamba-2 par GDN-2 plutôt que de simplement livrer davantage de couches Mamba-2 ?

Parce qu'à taille d'état récurrent équivalente, l'article mesure que Gated DeltaNet-2 devance, sur les tâches de récupération que les charges de travail agentiques à long contexte sollicitent réellement, au prix d'un léger surcoût constant en débit. Si votre charge de travail est intensive en récupération, ce compromis est favorable ; si elle est limitée par le débit à contexte court, la baseline Mamba-2 est la solution la moins coûteuse. Un banc d'essai 3B est un moyen judicieux de déterminer à laquelle de ces situations votre trafic ressemble.

Le statut open source des pièces signifie-t-il que le modèle serait également ouvert ?

Non. Les poids de Nemotron-3 Nano sont ouverts et le code de référence de Gated DeltaNet-2 est public, mais aucun de ces deux faits n’oblige quiconque à publier un checkpoint construit à partir d’eux — et la licence non commerciale du code GDN-2 signifie qu’une publication commerciale nécessiterait un autre arrangement. Les issues plausibles vont d’une publication de recherche NVIDIA sous la licence Nemotron Open Model License à quelque chose qui ne quitte jamais un cluster interne.

Y a-t-il quelque chose à essayer aujourd’hui ?

Oui, mais pas GDN-2-3B. Les checkpoints de l'article Gated DeltaNet-2 sont reproductibles depuis le dépôt NVlabs à 1,3B sur FineWeb-Edu, et Nemotron-3 Nano 30B-A3B et 4B tournent sur vLLM, SGLang, TensorRT-LLM et llama.cpp aujourd'hui. Tester l'une ou l'autre moitié vous indique ce que l'autre moitié ferait probablement — ce qui est plus que ce que le tweet vous donne.

Rien de tout cela ne rend GDN-2-3B réel. Cela le rend falsifiable, ce qui est le maximum qu’une seule phrase puisse offrir : il ne s’en faut que d’un fichier de configuration, d’une affirmation concernant un moteur ou d’un dépôt pour qu’il devienne soit une véritable sortie à court terme, soit une recombinaison d’apparence plausible qui ne sera jamais construite.