
Vazamento do GDN-2-3B: um híbrido Nemotron-3 Nano com Gated DeltaNet-2 no lugar do Mamba-2
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 477 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 187 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
Uma única frase publicada no X em 26 de setembro de 2026 é todo o registro público de GDN-2-3B até agora. A conta @teortaxesTex escreveu que "um candidato a lançamento de curto prazo é o MoE latente híbrido GDN-2-3B, que segue a arquitetura Nemotron-3 Nano, mas substitui as camadas Mamba-2 por GDN-2." É isso — nenhum repositório no Hugging Face, nenhum arquivo de configuração, nenhuma tabela de parâmetros, nenhum construtor nomeado, nenhuma data. O GDN-2-3B não foi lançado, e nada abaixo deve ser lido como se tivesse sido. O que torna a frase digna de ser destrinchada, de todo modo, é que ambas as suas metades nomeiam algo real e verificável: Gated DeltaNet-2 é uma arquitetura de atenção linear publicada pela NVIDIA, com uma implementação pública em PyTorch e uma movimentada trilha de portabilidade por ferramentas TPU, Triton e ONNX, e Nemotron-3 Nano é o híbrido Mamba-2 de pesos abertos lançado pela NVIDIA sobre o qual o modelo especulado está sendo enxertado. Este é um texto do tipo "o que sabemos até agora": a arquitetura está documentada, o modelo é um rumor, e a diferença entre essas duas coisas é toda a história.
Em resumo: Gated DeltaNet-2 muda como um modelo de atenção linear edita sua memória comprimida, e seus ganhos medidos recaem com mais força justamente sobre o trabalho de recuperação de contexto longo para o qual se compra um pequeno híbrido. O Nemotron-3 Nano é o menor nível da atual família híbrida da NVIDIA e o mais provável de ser reformulado com uma recorrência mais barata. Junte isso e você tem um candidato a lançamento plausível — e exatamente uma pessoa dizendo isso.
O que o tweet diz e o que não diz
Leia a frase atentamente, porque ela é incomumente densa e incomumente enxuta ao mesmo tempo. Ela diz que o candidato é híbrido (ou seja, mais de um tipo de camada), 3B (uma contagem de parâmetros pequena o suficiente para rodar em uma única GPU de consumidor), e um MoE latente (um design de roteamento de especialistas da NVIDIA no qual os tokens são projetados em uma dimensão latente menor antes de chegarem aos especialistas, que é o que os níveis Super 120B e Ultra 550B usam e o que o nível Nano disponibilizado não usa). Ela diz que o padrão de camadas segue o Nemotron-3 Nano. E ela diz que as camadas Mamba-2 são substituídas por GDN-2.
O que ele não diz: quem o está construindo. «One near-term release candidate» não tem sujeito. É tentador enxergar a NVIDIA nisso — o GDN-2 é pesquisa da NVIDIA e o Nemotron-3 Nano é um modelo da NVIDIA, então o pareamento parece um experimento interno —, mas o tweet não diz isso, e hoje um terceiro pode legalmente combinar os dois, porque os pesos do Nemotron-3 Nano são abertos e o código de referência do Gated DeltaNet-2 é público. Considere desconhecido quem o está construindo.
Também não diz quando. “Curto prazo” é o único sinal temporal, e não é uma data. Não há checkpoint para baixar, nenhum motor de inferência que afirme servi-lo e nenhum benchmark do próprio modelo em lugar algum. Todos os números deste artigo pertencem ao Gated DeltaNet-2 ou ao Nemotron-3 Nano conforme publicados separadamente. Nenhum deles pertence ao GDN-2-3B.
As duas metades do nome, e por que elas se encaixam
Gated DeltaNet-2 em um minuto
A atenção linear substitui o cache KV ilimitado da atenção softmax por um estado recorrente de tamanho fixo. A parte difícil não é decidir o que esquecer — é editar esse estado sem embaralhar associações que já estão armazenadas nele. Os modelos de regra delta subtraem a leitura atual antes de escrever um novo valor; o Kimi Delta Attention aguçou o esquecimento com decaimento por canal. Ambos, no entanto, ainda derivam duas decisões diferentes de um único portão escalar: quanto conteúdo antigo apagar no lado da chave e quanto conteúdo novo comprometer no lado do valor.
O Gated DeltaNet-2, publicado pelos pesquisadores da NVIDIA Ali Hatamizadeh, Yejin Choi e Jan Kautz (arXiv 2605.22791, código de referência no repositório NVlabs), divide esse escalar em dois gates por canal — um gate de apagamento sobre as coordenadas do lado da chave e um gate de escrita sobre as coordenadas do lado do valor — e mantém o decaimento por canal. O enquadramento do artigo é que o projeto generaliza estritamente o que veio antes: colapse ambos os gates no mesmo escalar e você recupera o Kimi Delta Attention; colapse também o decaimento e você recupera o Gated DeltaNet anterior. Em ablação, a NVIDIA relata que o gate de apagamento responde pela maior parte do ganho, o que condiz com seu papel de proteger as associações do lado da chave de serem sobrescritas.
A evidência é um estudo com parâmetros emparelhados, não um produto: todo modelo treinado com 1,3 bilhão de parâmetros em 100 bilhões de tokens FineWeb-Edu, com o tamanho do estado recorrente mantido igual entre Mamba-2, Gated DeltaNet, KDA e Mamba-3. Na configuração recorrente, o Gated DeltaNet-2 registra a melhor perplexidade no WikiText do grupo, 15,90, contra 16,79 do Mamba-2, e a melhor acurácia média em senso comum, 53,11, contra 52,39 do Mamba-3. Na configuração híbrida — a que de fato se assemelha ao padrão intercalado do Nemotron-3 Nano —, é 15,62 de perplexidade no WikiText e 53,97 de acurácia média, à frente do Mamba-3 (15,81 / 52,72) e bem à frente de uma linha de base Transformer simples (19,22 / 50,86).
Onde a vantagem se concentra é a parte que importa para um modelo pequeno de contexto longo. No teste de agulha no palheiro multi-chave recorrente do RULER em 4K, o Gated DeltaNet-2 obtém 37,8 contra 27,8 do Gated DeltaNet mais antigo e 28,0 do KDA; no teste de agulha única em 2K, obtém 89,8 contra 54,2. Na média de seis conjuntos reais de recuperação (SWDE, SQuAD, FDA, TriviaQA, NQ, DROP), lidera a fronteira recorrente com 29,88 contra 26,84 do Mamba-2, e a fronteira híbrida com 42,28 contra 40,14 do KDA. A NVIDIA também relata um escalonamento de throughput quase plano em função do comprimento da sequência em uma única H100, com apenas um pequeno custo fixo adicional em relação ao KDA pelos gates extras. Estes são números do fornecedor, das próprias tabelas do artigo, não reproduzidos por nós.

O plano Nemotron-3 Nano
Nemotron-3 Nano é um Mixture-of-Experts híbrido Mamba-Transformer, e é a arquitetura que está sendo emprestada, em vez do modelo. O lançamento 30B-A3B tem 52 camadas: 23 camadas Mamba-2, 23 camadas MoE e seis camadas de atenção de consulta agrupada, com 128 especialistas roteados mais um especialista compartilhado por bloco MoE e seis especialistas ativos por token. Ele possui 3,5B de parâmetros ativos contra 30B no total, foi pré-treinado em 25 trilhões de tokens e suporta janelas de contexto de até 1M de tokens; o próprio relatório técnico da NVIDIA afirma até 3,3x mais taxa de transferência de inferência do que modelos abertos de tamanho semelhante, como GPT-OSS-20B e Qwen3-30B-A3B-Thinking-2507. Ele é lançado sob a NVIDIA Nemotron Open Model License e é explicitamente liberado para uso comercial.
Há um irmão menor que vale a pena conhecer, porque o "3B" no nome especulado fica próximo dele: Nemotron-3 Nano 4B, comprimido a partir do NVIDIA-Nemotron-Nano-9B-v2 usando o framework Elastic da NVIDIA, é "principalmente camadas Mamba-2 e MLP combinadas com apenas quatro camadas de Attention." Então o nível Nano já é a parte da família que é comprimida e recortada. Essa é a razão mais plausível de todas para que uma variante experimental de 3B sequer exista.
Vale a pena destacar duas discrepâncias. Primeiro, são os grandes Nemotron-3 Super 120B-A12B e Nemotron-3 Ultra 550B-A55 — que usam MoE latente; o tier Nano não usa. Um MoE latente não é um port direto de uma configuração MoE existente, mas sim uma recombinação de ideias dos tiers, que é exatamente o tipo de coisa que aparece em checkpoints antes de aparecer em um produto. Segundo, os blocos MoE da família Nano são de especialistas densos; mudar para MoE latente altera a camada de especialistas ativa, então o rótulo 3B diria muito pouco sobre o custo real de servir o modelo quando um arquivo de configuração aparecer.
A trilha de portabilidade é real — o modelo não é
O que pode ser verificado é que o Gated DeltaNet-2 está sendo integrado a runtimes de produção em ritmo acelerado. Em 23 de setembro de 2026, um pull request ao repositório Tokamax da OpenXLA adicionou um kernel e operador Pallas do Gated Delta Net 2 para TPU, incluindo uma passagem reversa de autograd em seis entradas e números de benchmark em Cloud TPU v7x. O Flash Linear Attention carrega kernels de prefill fundidos do GDN-2 desde o final de junho — o pull request de lá relata um ganho de velocidade de prefill médio de 2,48x e um melhor caso de 5,13x em uma H100 — com acompanhamentos em setembro que corrigem um bug de ordenação de gate e otimizam o caminho de treinamento por chunks. O ONNX tem uma lacuna de especificação aberta registrada contra ele, porque o operador LinearAttention do opset 27 não consegue expressar o gate de apagamento por canal do GDN-2. E o Megatron-Bridge da própria NVIDIA adicionou contabilização de FLOPs tanto para camadas GDN híbridas quanto para compressão latent-MoE em março.
Nada disso é um lançamento de modelo, e seria um erro interpretá-lo como tal. O trabalho de kernel é infraestrutura; ele indica que uma arquitetura está sendo levada a sério, não que existe um checkpoint. O que isso oferece é algo concreto para monitorar: se um híbrido GDN-2 chegar ao mundo, ele chegará primeiro como suporte sendo implementado em uma engine de serving e só depois como anúncio, e o suporte na engine já está parcialmente implementado. O trabalho do Tokamax e do Flash Linear Attention também é o argumento mais forte de que o pareamento no tweet é tecnicamente coerente, e não inventado — as peças necessárias para servir um híbrido GDN-2 estão sendo construídas por pessoas que não são a pessoa que escreveu o tweet.

Por que um híbrido 3B GDN-2 importaria se for lançado
O argumento a favor da combinação é econômico, e não orientado por benchmarks. Um híbrido da classe 3B com um estado recorrente de tamanho fixo é um modelo que você consegue executar em uma única GPU de consumidor sem um cache KV que cresce com o seu prompt, que é o mesmo acordo vantajoso que o Nemotron-3 Nano 4B já oferece. Substituir as camadas Mamba-2 por GDN-2 rende, segundo os números do artigo, melhor recuperação multi-chave e melhores médias de recuperação do mundo real com tamanho de estado equivalente — os dois pontos em que a família mais antiga de regras delta era mais fraca. Trata-se de uma atualização direcionada, não geracional, e é o tipo de mudança que valeria 3B de parâmetros.
É também um lembrete de que a competição interessante nos modelos pequenos passou da contagem de parâmetros para o design de memória. Um modelo de 3B cujo estado recorrente é um tensor fixo comporta-se de forma diferente sob prompts longos do que um transformer de 3B com um cache KV quantizado: a memória é constante, mas o modelo tem um orçamento fixo para o que consegue recordar, e a elegância com que esquece é agora a especificação. Toda a contribuição do Gated DeltaNet-2 é uma regra de esquecimento melhor. Isso faz dele um design que vale a pena acompanhar por mérito próprio, mesmo que o GDN-2-3B nunca apareça com esse nome.
Como você realmente testaria algo assim
Quando uma arquitetura não comprovada chega a um runtime de serving, o obstáculo para a maioria das equipes não é a tabela de benchmarks — é que adotá-la significa uma nova integração, um novo contrato e um novo modo de falha, tudo contra um modelo sem histórico de produção. Isso é um problema de roteamento antes de ser um problema de modelo. Um agregador que coloca um novo endpoint atrás da mesma chave que você já usa significa que você pode enviar uma fração do tráfego real para ele, manter seu modelo existente como fallback e deixar failover automático capturar os erros enquanto a nova rota ainda está instável — uma API única para mais de 200 modelos pelo preço de tabela do provedor com 0% de markup, então o preço que lhe foi cotado é o preço que você paga e um corte de preço do fornecedor aparece no mesmo dia, em vez de só na próxima fatura. O próprio GDN-2-3B não está hospedado em lugar nenhum, nem por nós nem por ninguém; é isso que "não lançado" significa. O ponto é o padrão que você usaria no dia em que for lançado.
Se você quiser ver quais modelos híbridos e de contexto longo podem ser roteados hoje, o catálogo de modelos ao vivo é a lista honesta — ele indica o que realmente pode ser servido, em vez do que foi anunciado.

O que observar, e o que falsificaria isso
O vazamento se resolve de uma de três maneiras, e cada uma tem um sinal revelador:
• Um arquivo de configuração — a confirmação mais forte seria uma configuração no estilo Nemotron-H listando tipos de camada GDN-2 em um padrão de override híbrido. Enquanto não existir um config.json como esse, tudo é inferência a partir de uma frase.
• Suporte de engine para um checkpoint específico — os kernels do GDN-2 já existem; o que não existe é nenhuma engine que se proponha a servir um híbrido GDN-2 nomeado. O fechamento dessa lacuna é o verdadeiro sinal.
• Uma mudança de licença — esta é fácil de passar despercebida. O código de referência do Gated DeltaNet-2 é lançado sob a NVIDIA Source Code License-NC, que é não comercial, enquanto os pesos do modelo Nemotron são distribuídos sob a NVIDIA Nemotron Open Model License, que não o é. Um híbrido que combinasse os dois teria de resolver essa tensão, e a forma como a resolve diz-lhe se o resultado é um artefacto de investigação ou algo que pudesse colocar em produção.
Duas coisas falseariam o enquadramento aqui. Se o “3B” no nome acabar significando algo diferente de parâmetros totais — parâmetros ativos, ou uma contagem de camadas, ou simplesmente um codinome —, a economia muda completamente. E se a expressão “latent MoE” acabar descrevendo um bloco MoE comum, então esta é uma ideia muito menor do que parece: um Nano recortado com uma camada linear diferente, não um novo formato.
Perguntas que isso levanta
Como o Gated DeltaNet-2 é diferente do Gated DeltaNet que já está dentro do Qwen3.8?
O Gated DeltaNet anterior usa um único gate escalar tanto para apagar quanto para escrever; o Gated DeltaNet-2 divide-o em dois gates por canal e acrescenta decaimento por canal emprestado do Kimi Delta Attention. Portanto, trata-se de uma generalização estrita, e não de um substituto, e a diferença prática manifesta-se na recuperação, não na perplexidade — a lacuna em needle-in-a-haystack com múltiplas chaves é muito maior do que a lacuna no WikiText.
Por que alguém trocaria o Mamba-2 pelo GDN-2 em vez de simplesmente lançar mais camadas de Mamba-2?
Porque, com tamanho de estado recorrente equivalente, o artigo mede o Gated DeltaNet-2 à frente nas tarefas de recuperação que as cargas de trabalho agênticas de contexto longo realmente exercitam, ao custo de uma pequena sobrecarga constante no throughput. Se a sua carga de trabalho for intensiva em recuperação, essa troca é favorável; se for limitada pelo throughput em contexto curto, a linha de base Mamba-2 é a resposta mais barata. Um ambiente de testes de 3B é uma forma sensata de descobrir a qual delas o seu tráfego se assemelha.
O status de código aberto das peças significa que o modelo também seria aberto?
Não. Os pesos do Nemotron-3 Nano são abertos e o código de referência do Gated DeltaNet-2 é público, mas nenhum dos dois fatos obriga ninguém a publicar um checkpoint criado a partir deles — e a licença não comercial do código do GDN-2 significa que um lançamento comercial precisaria de um acordo diferente. Os desfechos plausíveis vão desde um lançamento de pesquisa da NVIDIA sob a Nemotron Open Model License até algo que nunca sai de um cluster interno.
Há algo para experimentar hoje?
Sim, mas não o GDN-2-3B. Os checkpoints do artigo do Gated DeltaNet-2 são reproduzíveis a partir do repositório da NVlabs em 1,3B no FineWeb-Edu, e o Nemotron-3 Nano 30B-A3B e o 4B rodam em vLLM, SGLang, TensorRT-LLM e llama.cpp hoje. Testar qualquer uma das metades revela o que a outra metade provavelmente faria — o que é mais do que o tweet oferece.
Nada disso torna o GDN-2-3B real. Isso o torna falsificável, que é o máximo que uma única frase pode oferecer: a um arquivo de configuração, a uma alegação sobre o motor, ou a um repositório de distância de ser um lançamento genuíno de curto prazo ou uma recombinação que soa plausível e que nunca chega a ser construída.
