
Leak di GDN-2-3B: un ibrido Nemotron-3 Nano con Gated DeltaNet-2 al posto di Mamba-2
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 477 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 187 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
Una singola frase pubblicata su X il 26 settembre 2026 costituisce l'intero registro pubblico di GDN-2-3B finora. L'account @teortaxesTex ha scritto che "uno dei candidati di rilascio a breve termine è il modello ibrido GDN-2-3B latent MoE, che segue l'architettura Nemotron-3 Nano ma sostituisce i layer Mamba-2 con GDN-2." Tutto qui — nessun repository Hugging Face, nessun file di configurazione, nessuna tabella dei parametri, nessun builder con nome, nessuna data. GDN-2-3B non è stato rilasciato, e nulla di quanto segue dovrebbe essere letto come se lo fosse stato. Ciò che rende comunque utile analizzare quella riga è che entrambe le sue metà nominano qualcosa di reale e verificabile: Gated DeltaNet-2 è un'architettura di attenzione lineare pubblicata da NVIDIA, con un'implementazione PyTorch pubblica e un'intensa attività di porting attraverso gli strumenti TPU, Triton e ONNX, e Nemotron-3 Nano è il modello ibrido Mamba-2 open-weights distribuito da NVIDIA su cui il modello di cui si vocifera viene innestato. Questo è un pezzo su ciò che sappiamo finora: l'architettura è documentata, il modello è un rumor, e la differenza tra queste due cose è tutta la storia.
La versione breve: Gated DeltaNet-2 cambia il modo in cui un modello ad attenzione lineare modifica la propria memoria compressa, e i suoi guadagni misurati si fanno sentire più duramente proprio sul lavoro di recupero su contesti lunghi per cui si acquista un piccolo ibrido. Nemotron-3 Nano è il livello più piccolo dell'attuale famiglia ibrida di NVIDIA e quello più probabilmente ritagliato con una ricorrenza più economica. Metti insieme queste cose e ottieni un plausibile candidato al rilascio — e precisamente una persona che lo afferma.
Cosa dice e cosa non dice il tweet
Leggi la frase con attenzione, perché è insolitamente densa e insolitamente scarna allo stesso tempo. Afferma che il candidato è ibrido (quindi, più di un tipo di livello), 3B (un numero di parametri sufficientemente piccolo da poter essere eseguito su una singola GPU consumer), e un MoE latente (un design NVIDIA di routing degli esperti in cui i token vengono proiettati in una dimensione latente più piccola prima di raggiungere gli esperti, che è ciò che usano i tier Super 120B e Ultra 550B e che il tier Nano distribuito non fa). Dice che lo schema dei livelli segue Nemotron-3 Nano. E dice che i livelli Mamba-2 sono sostituiti con GDN-2.
Ciò che non dice: chi lo sta costruendo. "One near-term release candidate" non ha un soggetto. È allettante leggerci dentro NVIDIA — GDN-2 è ricerca NVIDIA e Nemotron-3 Nano è un modello NVIDIA, quindi l'abbinamento sembra un esperimento interno — ma il tweet non lo dice, e una terza parte può legalmente combinare i due già oggi, perché i pesi di Nemotron-3 Nano sono aperti e il codice di riferimento di Gated DeltaNet-2 è pubblico. Considera sconosciuto chi lo sta costruendo.
Né dice quando. «A breve termine» è l'unico segnale temporale, e non è una data. Non c'è alcun checkpoint da scaricare, nessun motore di inferenza che dichiari di servirlo e nessun benchmark del modello stesso da nessuna parte. Ogni dato in questo articolo appartiene a Gated DeltaNet-2 o a Nemotron-3 Nano come pubblicati separatamente. Nessuno di essi appartiene a GDN-2-3B.
Le due metà del nome, e perché combaciano
Gated DeltaNet-2 in un minuto
L'attenzione lineare sostituisce la cache KV illimitata dell'attenzione softmax con uno stato ricorrente di dimensione fissa. La parte difficile non è decidere cosa dimenticare — è modificare quello stato senza rimescolare le associazioni già in esso memorizzate. I modelli basati sulla regola delta sottraggono la lettura corrente prima di scrivere un nuovo valore; Kimi Delta Attention ha reso più netta la dimenticanza con un decadimento per canale. Entrambi, però, fanno ancora dipendere due decisioni diverse da un unico gate scalare: quanto vecchio contenuto cancellare sul lato delle chiavi e quanto nuovo contenuto memorizzare sul lato dei valori.
Gated DeltaNet-2, pubblicato dai ricercatori NVIDIA Ali Hatamizadeh, Yejin Choi e Jan Kautz (arXiv 2605.22791, codice di riferimento nel repository NVlabs), suddivide quello scalare in due gate a livello di canale — un gate di cancellazione sulle coordinate lato chiave e un gate di scrittura sulle coordinate lato valore — e mantiene il decadimento a livello di canale. L'impostazione dell'articolo è che il design generalizza in senso stretto quanto precede: riducendo entrambi i gate allo stesso scalare si recupera Kimi Delta Attention; riducendo anche il decadimento si recupera il precedente Gated DeltaNet. Nell'ablation, NVIDIA riporta che il gate di cancellazione è responsabile della maggior parte del guadagno, il che è coerente con il suo ruolo nel proteggere le associazioni lato chiave dall'essere sovrascritte.
Le evidenze provengono da uno studio a parametri appaiati, non da un prodotto: ogni modello è stato addestrato con 1,3 miliardi di parametri su 100 miliardi di token FineWeb-Edu, con la dimensione dello stato ricorrente mantenuta uguale tra Mamba-2, Gated DeltaNet, KDA e Mamba-3. Nella configurazione ricorrente Gated DeltaNet-2 registra la migliore perplessità WikiText del gruppo, pari a 15,90 contro il 16,79 di Mamba-2, e la migliore accuratezza media di senso comune, pari a 53,11 contro il 52,39 di Mamba-3. Nella configurazione ibrida — quella che assomiglia davvero al pattern interleaved di Nemotron-3 Nano — è 15,62 di perplessità WikiText e 53,97 di accuratezza media, davanti a Mamba-3 (15,81 / 52,72) e ben davanti a una semplice baseline Transformer (19,22 / 50,86).
Dove si concentra il vantaggio è la parte che conta per un piccolo modello a contesto lungo. Nel test ricorrente multi-chiave needle-in-a-haystack di RULER a 4K, Gated DeltaNet-2 ottiene 37.8 contro 27.8 del più vecchio Gated DeltaNet e 28.0 di KDA; su single-needle-at-2K ottiene 89.8 contro 54.2. Mediato su sei set di retrieval reali (SWDE, SQuAD, FDA, TriviaQA, NQ, DROP) guida la frontiera ricorrente a 29.88 contro 26.84 di Mamba-2, e la frontiera ibrida a 42.28 contro 40.14 di KDA. NVIDIA riporta inoltre uno scaling di throughput quasi piatto con la lunghezza della sequenza su una singola H100, con solo un piccolo overhead costante rispetto a KDA per i gate extra. Questi sono dati del fornitore dalle tabelle del paper stesso, non riprodotti da noi.

Il progetto Nemotron-3 Nano
Nemotron-3 Nano è un ibrido Mamba-Transformer Mixture-of-Experts, ed è l'architettura che viene presa in prestito, non il modello. Il rilascio 30B-A3B è composto da 52 layer: 23 layer Mamba-2, 23 layer MoE e sei layer di attenzione grouped-query, con 128 esperti instradati più un esperto condiviso per blocco MoE e sei esperti attivi per token. Ha 3,5B parametri attivi rispetto a 30B totali, è stato pre-addestrato su 25 trilioni di token e supporta finestre di contesto fino a 1M token; il rapporto tecnico di NVIDIA stesso afferma un throughput di inferenza fino a 3,3x superiore rispetto a modelli aperti di dimensioni simili come GPT-OSS-20B e Qwen3-30B-A3B-Thinking-2507. È rilasciato con licenza NVIDIA Nemotron Open Model License ed è esplicitamente autorizzato per uso commerciale.
Esiste un fratello minore che vale la pena conoscere, perché il "3B" nel nome ipotizzato gli si avvicina molto: Nemotron-3 Nano 4B, compresso da NVIDIA-Nemotron-Nano-9B-v2 usando il framework Elastic di NVIDIA, è "principalmente livelli Mamba-2 e MLP combinati con appena quattro livelli di Attention". Quindi il tier Nano è già la parte della famiglia che viene spremuta e ritagliata. Questa è la singola ragione più plausibile per cui una variante sperimentale 3B esisterebbe affatto.
Due incongruenze meritano di essere segnalate anziché attenuate. Primo, nella famiglia rilasciata sono i grandi tier — Nemotron-3 Super 120B-A12B e Nemotron-3 Ultra 550B-A55B — a usare il MoE latente; il tier Nano no. Un "MoE latente di forma Nano" non è quindi un semplice porting di una configurazione NVIDIA esistente, ma una ricombinazione delle idee di due tier, che è esattamente il tipo di cosa che compare nei checkpoint di ricerca prima di apparire in un prodotto. Secondo, i blocchi MoE della famiglia Nano usano il routing con esperti densi; passare al routing latente cambia il profilo FLOP di ogni livello di esperti, quindi un'etichetta 3B direbbe molto poco su quanto costi effettivamente servire il modello finché non compare un file di configurazione.
La traccia del porting è reale — il modello no.
Ciò che può essere verificato è che Gated DeltaNet-2 viene integrato nei runtime di produzione a gran velocità. Il 23 settembre 2026, una pull request al repository Tokamax di OpenXLA ha aggiunto un kernel e un operatore Pallas per Gated Delta Net 2 su TPU, inclusi un backward pass autograd su sei input e numeri di benchmark su Cloud TPU v7x. Flash Linear Attention include kernel prefill fusi per GDN-2 dalla fine di giugno — la pull request in questione riporta uno speedup medio del prefill di 2,48x e un caso migliore di 5,13x su una H100 — con follow-up a settembre che correggono un bug nell'ordinamento dei gate e ottimizzano il percorso di addestramento a chunk. Su ONNX è stata aperta una segnalazione di lacuna nella specifica, perché l'operatore LinearAttention dell'opset 27 non è in grado di esprimere il gate di cancellazione channel-wise di GDN-2. E il Megatron-Bridge di NVIDIA ha aggiunto a marzo il conteggio dei FLOPs sia per i livelli GDN ibridi sia per la compressione latent-MoE.
Niente di tutto ciò è il rilascio di un modello, e sarebbe un errore leggerlo come tale. Il lavoro sui kernel è infrastruttura; dice che un'architettura viene presa sul serio, non che esiste un checkpoint. Quello che però ti offre è una cosa concreta da monitorare: se un ibrido GDN-2 arriverà davvero al mondo, arriverà prima come supporto che approda in un motore di serving e solo dopo come annuncio, e il supporto nel motore è già in parte presente. Il lavoro su Tokamax e Flash Linear Attention è anche l'argomento più forte a dimostrazione che l'abbinamento nel tweet è tecnicamente coerente anziché inventato — i pezzi necessari per servire un ibrido GDN-2 vengono costruiti da persone che non sono l'autore del tweet.

Perché un ibrido GDN-2 da 3B sarebbe importante se venisse rilasciato
La giustificazione di questa combinazione è economica, non dettata dai benchmark. Un ibrido di classe 3B con uno stato ricorrente a dimensione fissa è un modello che puoi eseguire su una singola GPU consumer senza una KV cache che cresce con il prompt, lo stesso compromesso che Nemotron-3 Nano 4B fa già. Sostituire i layer Mamba-2 con GDN-2, secondo i numeri del paper, offre un migliore recupero multi-chiave e migliori medie di recupero nel mondo reale a parità di dimensione dello stato — i due punti in cui la più vecchia famiglia a regola delta era più debole. Si tratta di un aggiornamento mirato, non generazionale, ed è il tipo di cambiamento che varrebbe 3B di parametri.
È anche un promemoria del fatto che la competizione interessante nei piccoli modelli si è spostata dal conteggio dei parametri alla progettazione della memoria. Un modello da 3B il cui stato ricorrente è un tensore fisso si comporta diversamente, sotto prompt lunghi, rispetto a un transformer da 3B con una cache KV quantizzata: la memoria è piatta, ma il modello ha un budget fisso per ciò che può ricordare, e quanto con grazia dimentica è ormai la specifica. L'intero contributo di Gated DeltaNet-2 è una regola di dimenticanza migliore. Questo lo rende un progetto che vale la pena osservare di per sé, anche se GDN-2-3B non apparirà mai con quel nome.
Come testeresti davvero qualcosa del genere
Quando un'architettura non ancora collaudata arriva a un runtime di serving, l'ostacolo per la maggior parte dei team non è la tabella dei benchmark — è che adottarla significa una nuova integrazione, un nuovo contratto e una nuova modalità di guasto, il tutto per un modello senza storico di produzione. Questo è un problema di routing prima ancora che un problema di modello. Un aggregatore che mette un nuovo endpoint dietro la stessa chiave che già usi significa che puoi inviargli una porzione di traffico reale, mantenere il modello esistente come fallback e lasciare che il failover automatico intercetti gli errori mentre la nuova rotta è ancora instabile — una sola API su oltre 200 modelli al prezzo di listino del provider con 0% di markup, così il prezzo che ti è stato quotato è il prezzo che paghi e un taglio del fornitore si vede lo stesso giorno invece che alla fattura successiva. GDN-2-3B stesso non è ospitato da nessuna parte, né da noi né da altri; questo è ciò che significa "unreleased". Il punto è il pattern che useresti il giorno in cui lo sarà.
Se vuoi vedere quali modelli ibridi e a contesto lungo sono instradabili oggi, il catalogo live dei modelli è la lista onesta — indica ciò che è effettivamente utilizzabile piuttosto che ciò che è stato annunciato.

Cosa tenere d'occhio, e cosa falsificherebbe questo
La fuga si risolve in uno dei tre modi, e ciascuno ha un indizio:
• Un file di configurazione — la conferma più forte in assoluto sarebbe una configurazione in stile Nemotron-H che elenca i tipi di layer GDN-2 in un pattern di override ibrido. Finché non esiste un config.json del genere, tutto è un'inferenza da una frase.
• Supporto del motore per uno specifico checkpoint — i kernel GDN-2 esistono già; ciò che non esiste è un motore che dichiari di servire un ibrido GDN-2 con un nome preciso. La chiusura di questo divario è il vero segnale.
• Un cambio di licenza — questo è facile da lasciarsi sfuggire. Il codice di riferimento di Gated DeltaNet-2 è rilasciato sotto la NVIDIA Source Code License-NC, che è non commerciale, mentre i pesi del modello Nemotron sono distribuiti sotto la NVIDIA Nemotron Open Model License, che non lo è. Un ibrido che combinasse i due dovrebbe risolvere questa tensione, e il modo in cui la risolve ti dice se il risultato è un artefatto di ricerca o qualcosa che potresti mettere in produzione.
Due cose falsificherebbero l'impostazione qui. Se il "3B" nel nome si rivelasse indicare qualcosa di diverso dai parametri totali — parametri attivi, o un numero di layer, o semplicemente un nome in codice — l'economia cambierebbe completamente. E se la frase "latent MoE" si rivelasse descrivere un semplice blocco MoE, allora questa è un'idea molto più piccola di quanto sembri: un Nano re-cut con un layer lineare diverso, non una nuova forma.
Domande che questo solleva
In che cosa differisce Gated DeltaNet-2 dal Gated DeltaNet già presente all'interno di Qwen3.8?
Il precedente Gated DeltaNet utilizza un singolo gate scalare sia per la cancellazione sia per la scrittura; Gated DeltaNet-2 lo suddivide in due gate per canale e aggiunge un decadimento per canale preso in prestito da Kimi Delta Attention. Quindi è una generalizzazione stretta anziché una sostituzione, e la differenza pratica emerge nel retrieval, non nella perplexity — il divario su multi-key needle-in-a-haystack è molto più ampio del divario su WikiText.
Perché mai qualcuno dovrebbe sostituire Mamba-2 con GDN-2 invece di limitarsi a rilasciare più livelli di Mamba-2?
Poiché a parità di dimensione dello stato ricorrente l’articolo misura Gated DeltaNet-2 in vantaggio sulle attività di retrieval che i carichi di lavoro agentici a contesto lungo effettivamente esercitano, al costo di un piccolo overhead costante in throughput. Se il tuo carico di lavoro è intensivo in termini di retrieval, questo compromesso è favorevole; se è vincolato dal throughput a contesto breve, la baseline Mamba-2 è la risposta più economica. Un banco di prova da 3B è un modo sensato per scoprire a quale dei due assomiglia il tuo traffico.
Lo stato open source dei componenti significa che anche il modello sarebbe aperto?
No. I pesi di Nemotron-3 Nano sono aperti e il codice di riferimento di Gated DeltaNet-2 è pubblico, ma nessuno dei due fatti obbliga qualcuno a pubblicare un checkpoint costruito a partire da essi — e la licenza non commerciale sul codice GDN-2 significa che un rilascio commerciale richiederebbe un accordo diverso. Gli esiti plausibili spaziano da un rilascio di ricerca NVIDIA sotto la Nemotron Open Model License a qualcosa che non lascia mai un cluster interno.
C'è qualcosa da provare oggi?
Sì, ma non GDN-2-3B. I checkpoint del paper Gated DeltaNet-2 sono riproducibili dal repository NVlabs a 1,3B su FineWeb-Edu, e Nemotron-3 Nano 30B-A3B e 4B girano oggi su vLLM, SGLang, TensorRT-LLM e llama.cpp. Testare una delle due metà ti dice cosa probabilmente farebbe l'altra metà — il che è più di quanto ti dia il tweet.
Niente di tutto ciò rende GDN-2-3B reale. Lo rende falsificabile, che è il massimo che una singola frase possa offrire: a un file di configurazione, a una dichiarazione su un engine o a un repository di distanza dall’essere una vera release a breve termine oppure una ricombinazione dall’aria plausibile che non viene mai costruita.
