Tarjeta de título principal con el titular 'GDN-2-3B' y el subtítulo 'Un híbrido Nemotron-3 Nano con Mamba-2 cambiado por Gated DeltaNet-2: un tuit, sin pesos', tres chips de estado que dicen 'no publicado', 'fuente única' y 'sin benchmarks', y una línea de pie de página: 'Candidato de lanzamiento no verificado nombrado en una sola publicación de X el 2026-09-26.' Logotipo de OrcaRouter abajo a la derecha.
Guides & Insights

Filtración de GDN-2-3B: un híbrido de Nemotron-3 Nano con Gated DeltaNet-2 en lugar de Mamba-2

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Una sola frase publicada en X el 26 de septiembre de 2026 es todo el registro público de GDN-2-3B hasta ahora. La cuenta @teortaxesTex escribió que «un candidato a lanzamiento a corto plazo es el MoE latente híbrido GDN-2-3B, que sigue la arquitectura de Nemotron-3 Nano pero reemplaza las capas de Mamba-2 con GDN-2». Eso es todo: no hay repositorio de Hugging Face, ni archivo de configuración, ni tabla de parámetros, ni constructor con nombre, ni fecha. GDN-2-3B no se ha publicado, y nada de lo que sigue debe leerse como si así fuera. Lo que hace que la frase valga la pena desglosar de todos modos es que ambas mitades nombran algo real y verificable: Gated DeltaNet-2 es una arquitectura de atención lineal publicada por NVIDIA, con una implementación pública en PyTorch y un intenso historial de portado a través de herramientas de TPU, Triton y ONNX, y Nemotron-3 Nano es el híbrido Mamba-2 de pesos abiertos ya lanzado por NVIDIA al que se está injertando el modelo rumoreado. Este es un artículo de lo que sabemos hasta ahora: la arquitectura está documentada, el modelo es un rumor, y la diferencia entre esas dos cosas es toda la historia.

La versión corta: Gated DeltaNet-2 cambia cómo un modelo de atención lineal edita su memoria comprimida, y sus ganancias medidas recaen con más fuerza justo en el trabajo de recuperación de contexto largo para el que se compra un híbrido pequeño. Nemotron-3 Nano es el nivel más pequeño de la familia híbrida actual de NVIDIA y el que más probabilidades tiene de ser reconfigurado con una recurrencia más barata. Junta esas dos cosas y tienes un candidato de lanzamiento plausible — y exactamente una persona que lo afirma.

Lo que el tuit dice y no dice

Lee la frase con atención, porque es inusualmente densa e inusualmente escueta al mismo tiempo. Dice que el candidato es híbrido (así que, más de un tipo de capa), 3B (un número de parámetros lo suficientemente pequeño como para ejecutarse en una GPU de consumo), y un MoE latente (un diseño de enrutamiento de expertos de NVIDIA en el que los tokens se proyectan en una dimensión latente más pequeña antes de llegar a los expertos, que es lo que utilizan los niveles Super 120B y Ultra 550B y lo que no hace el nivel Nano lanzado). Dice que el patrón de capas sigue a Nemotron-3 Nano. Y dice que las capas Mamba-2 se reemplazan con GDN-2.

Lo que no dice: quién lo está construyendo. «Un candidato de lanzamiento a corto plazo» no tiene sujeto. Es tentador ver a NVIDIA en ello —GDN-2 es investigación de NVIDIA y Nemotron-3 Nano es un modelo de NVIDIA, así que la combinación parece un experimento interno—, pero el tuit no dice eso, y un tercero puede combinar legalmente los dos hoy, porque los pesos de Nemotron-3 Nano son abiertos y el código de referencia de Gated DeltaNet-2 es público. Trata al constructor como desconocido.

Tampoco dice cuándo. «A corto plazo» es la única señal temporal, y no es una fecha. No hay ningún checkpoint que descargar, ningún motor de inferencia que afirme servirlo y ningún benchmark del propio modelo en ninguna parte. Cada cifra de este artículo pertenece a Gated DeltaNet-2 o a Nemotron-3 Nano según sus respectivas publicaciones por separado. Ninguna de ellas pertenece a GDN-2-3B.

Las dos mitades del nombre, y por qué encajan

Gated DeltaNet-2 en un minuto

La atención lineal reemplaza la caché KV ilimitada de la atención softmax por un estado recurrente de tamaño fijo. La parte difícil no es decidir qué olvidar, sino editar ese estado sin desordenar las asociaciones que ya están almacenadas en él. Los modelos de regla delta restan la lectura actual antes de escribir un nuevo valor; Kimi Delta Attention agudizó el olvido con decaimiento por canal. Sin embargo, ambos siguen derivando dos decisiones distintas de una única compuerta escalar: cuánto contenido antiguo borrar del lado de la clave y cuánto contenido nuevo asentar del lado del valor.

Gated DeltaNet-2, publicado por los investigadores de NVIDIA Ali Hatamizadeh, Yejin Choi y Jan Kautz (arXiv 2605.22791, código de referencia en el repositorio de NVlabs), divide ese escalar en dos compuertas por canal —una compuerta de borrado sobre las coordenadas del lado de las claves y una compuerta de escritura sobre las coordenadas del lado de los valores— y mantiene el decaimiento por canal. El planteamiento del artículo es que el diseño generaliza estrictamente lo que vino antes: si se colapsan ambas compuertas en el mismo escalar, se recupera Kimi Delta Attention; si se colapsa también el decaimiento, se recupera el Gated DeltaNet anterior. En el análisis de ablación, NVIDIA informa de que la compuerta de borrado es responsable de la mayor parte de la mejora, lo que encaja con su función de proteger las asociaciones del lado de las claves para que no se sobrescriban.

La evidencia es un estudio de parámetros emparejados, no un producto: todos los modelos entrenados con 1,3B de parámetros sobre 100B tokens de FineWeb-Edu, con el tamaño del estado recurrente igualado entre Mamba-2, Gated DeltaNet, KDA y Mamba-3. En la configuración recurrente, Gated DeltaNet-2 registra la mejor perplejidad de WikiText del grupo, con 15,90 frente a 16,79 de Mamba-2, y la mejor precisión media en sentido común, con 53,11 frente a 52,39 de Mamba-3. En la configuración híbrida —la que realmente se asemeja al patrón intercalado de Nemotron-3 Nano—, presenta 15,62 de perplejidad de WikiText y 53,97 de precisión media, por delante de Mamba-3 (15,81 / 52,72) y muy por delante de una línea base de Transformer simple (19,22 / 50,86).

Dónde se concentra la ventaja es lo que importa para un modelo pequeño de contexto largo. En la prueba recurrente de aguja en un pajar con múltiples claves de RULER a 4K, Gated DeltaNet-2 obtiene 37,8 frente a 27,8 de la antigua Gated DeltaNet y 28,0 de KDA; en la de una sola aguja a 2K obtiene 89,8 frente a 54,2. En promedio, en seis conjuntos reales de recuperación (SWDE, SQuAD, FDA, TriviaQA, NQ, DROP), lidera la frontera recurrente con 29,88 frente a 26,84 de Mamba-2, y la frontera híbrida con 42,28 frente a 40,14 de KDA. NVIDIA también reporta un escalado de throughput casi plano con la longitud de secuencia en una sola H100, con solo una pequeña sobrecarga constante sobre KDA por las puertas adicionales. Estas son cifras del proveedor de las propias tablas del artículo, no reproducidas por nosotros.

Two-column comparison scoreboard titled 'Mamba-2 vs Gated DeltaNet-2 - the scoreboard'. Left column 'Mamba-2': Decay scalar; Erase gate none; Write gate scalar; WikiText ppl 16.79; LMB ppl 12.38; Retrieval avg 26.84. Right column 'Gated DeltaNet-2': Decay channel-wise; Erase gate channel-wise b; Write gate channel-wise w; WikiText ppl 15.90; LMB ppl 11.41; Retrieval avg 29.88. Footer: both recurrent-only, 1.3B params, 100B FineWeb-Edu tokens, figures per NVIDIA's Gated DeltaNet-2 paper, not independently reproduced. OrcaRouter logo bottom-right.

El plano de Nemotron-3 Nano

Nemotron-3 Nano es un híbrido Mamba-Transformer de tipo Mixture-of-Experts, y lo que se toma prestado es la arquitectura, no el modelo. La versión 30B-A3B tiene 52 capas: 23 capas Mamba-2, 23 capas MoE y seis capas de atención con consultas agrupadas, con 128 expertos enrutados más un experto compartido por bloque MoE y seis expertos activos por token. Cuenta con 3.5B parámetros activos frente a 30B en total, se preentrenó con 25 billones de tokens y admite ventanas de contexto de hasta 1M tokens; el propio informe técnico de NVIDIA afirma un rendimiento de inferencia hasta 3.3x superior al de modelos abiertos de tamaño similar como GPT-OSS-20B y Qwen3-30B-A3B-Thinking-2507. Se publica bajo la NVIDIA Nemotron Open Model License y está autorizado explícitamente para uso comercial.

Hay un hermano menor que conviene conocer, porque el "3B" del nombre rumoreado queda muy cerca de él: Nemotron-3 Nano 4B, comprimido a partir de NVIDIA-Nemotron-Nano-9B-v2 usando el framework Elastic de NVIDIA, es "principalmente capas Mamba-2 y MLP combinadas con solo cuatro capas de atención". Así que el nivel Nano ya es la parte de la familia que se exprime y se recorta. Esa es la razón más plausible de todas por la que existiría siquiera una variante experimental de 3B.

Dos discrepancias merecen señalarse en lugar de disimularse. En primer lugar, en la familia comercializada son los grandes tiers —Nemotron-3 Super 120B-A12B y Nemotron-3 Ultra 550B-A55B— los que usan MoE latente; el tier Nano no. Un "MoE latente con forma de Nano" no es, por tanto, una adaptación directa de una configuración existente de NVIDIA, sino una recombinación de las ideas de dos tiers, que es exactamente el tipo de cosa que aparece en checkpoints de investigación antes de aparecer en un producto. En segundo lugar, los bloques MoE de la familia Nano están enrutados a expertos densos; pasar a enrutamiento latente cambia el perfil de FLOP de cada capa de expertos, así que una etiqueta de 3B te diría muy poco sobre lo que cuesta realmente servir el modelo hasta que aparezca un archivo de configuración.

El rastro del porting es real — el modelo no

Lo que puede verificarse es que Gated DeltaNet-2 se está integrando en runtimes de producción a toda velocidad. El 23 de septiembre de 2026, una pull request al repositorio Tokamax de OpenXLA añadió un kernel y operador Pallas de Gated Delta Net 2 para TPU, incluida una pasada hacia atrás de autograd a través de seis entradas y cifras de benchmark en Cloud TPU v7x. Flash Linear Attention ha llevado kernels de prefill fusionados de GDN-2 desde finales de junio —la pull request correspondiente reporta una aceleración media de prefill de 2,48x y un mejor caso de 5,13x en una H100—, con seguimientos en septiembre que corrigieron un error de ordenación de compuertas y optimizaron la ruta de entrenamiento por chunks. ONNX tiene una brecha de especificación abierta presentada en su contra, porque el operador LinearAttention del opset 27 no puede expresar la compuerta de borrado por canal de GDN-2. Y el propio Megatron-Bridge de NVIDIA añadió contabilidad de FLOPs tanto para las capas GDN híbridas como para la compresión de MoE latente en marzo.

Nada de eso es un lanzamiento de modelo, y sería un error leerlo como si lo fuera. El trabajo de kernels es infraestructura; indica que una arquitectura se está tomando en serio, no que exista un checkpoint. Lo que sí te da es algo concreto que monitorear: si un híbrido GDN-2 llega a ver la luz, llegará primero como soporte que aterriza en un motor de servicio y segundo como un anuncio, y el soporte del motor ya está parcialmente en su lugar. El trabajo de Tokamax y Flash Linear Attention es también el argumento más fuerte de que la combinación del tuit es técnicamente coherente y no inventada: las piezas necesarias para servir un híbrido GDN-2 las están construyendo personas que no son la persona que escribió el tuit.

Screenshot of the NVlabs/GatedDeltaNet-2 GitHub repository page in English: the title 'Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention', the file list with README.md, LICENSE, SECURITY.md and lit_gpt/scripts directories, and the About panel showing 317 stars, 33 forks and a last commit from last month.

Por qué un híbrido GDN-2 de 3B importaría si se lanza

El argumento a favor de la combinación es económico, más que estar impulsado por benchmarks. Un híbrido de la clase 3B con un estado recurrente de tamaño fijo es un modelo que puedes ejecutar en una sola GPU de consumo sin una caché KV que crezca con tu prompt, que es el mismo compromiso que ya ofrece Nemotron-3 Nano 4B. Cambiar las capas Mamba-2 por GDN-2 aporta, según los números del artículo, mejor recuperación multi-clave y mejores promedios de recuperación del mundo real con el mismo tamaño de estado — los dos puntos donde la antigua familia de reglas delta era más débil. Es una mejora específica, no generacional, y es el tipo de cambio que justificaría 3B de parámetros.

También es un recordatorio de que la competencia interesante en los modelos pequeños ha pasado de los recuentos de parámetros al diseño de la memoria. Un modelo de 3B cuyo estado recurrente es un tensor fijo se comporta de manera distinta ante prompts largos que un transformer de 3B con una caché KV cuantizada: la memoria es plana, pero el modelo tiene un presupuesto fijo para lo que puede recordar, y la elegancia con la que olvida es ahora la especificación. Toda la contribución de Gated DeltaNet-2 es una mejor regla de olvido. Eso lo convierte en un diseño que merece la pena seguir por sus propios méritos, incluso si GDN-2-3B nunca aparece bajo ese nombre.

Cómo probarías realmente algo como esto

Cuando una arquitectura no probada llega a un entorno de ejecución de servicio, el obstáculo para la mayoría de los equipos no es la tabla de referencia, sino que adoptarla implica una nueva integración, un nuevo contrato y un nuevo modo de fallo, todo ello con un modelo sin historial de producción. Eso es un problema de enrutamiento antes que un problema de modelo. Un agregador que coloca un nuevo punto de conexión detrás de la misma clave que ya usas significa que puedes enviarle una porción de tráfico real, mantener tu modelo existente como respaldo y dejar que la conmutación automática por error capture los errores mientras la nueva ruta aún es inestable — una API para más de 200 modelos a precio de lista del proveedor con 0% de margen, de modo que el precio que te cotizaron es el precio que pagas y un recorte de proveedor aparece el mismo día en lugar de en la siguiente factura. GDN-2-3B en sí no está alojado en ningún sitio, ni por nosotros ni por nadie más; eso es lo que significa "no publicado". El punto es el patrón que usarías el día que lo esté.

Si quieres ver qué modelos híbridos y de contexto largo se pueden enrutar hoy en día, el catálogo de modelos en vivo es la lista honesta — marca lo que realmente se puede servir, no lo que se ha anunciado.

Screenshot of the OrcaRouter model catalogue at orcarouter.ai/models, headline '204 models - 16 providers - one API key, one bill', with the filter rail for input modalities, context length, input price, status and series, the Models / Leaderboard / Offers / playground tabs, and a 'How to call any model' panel.

Qué observar y qué falsificaría esto

La filtración se resuelve de una de tres maneras, y cada una tiene un indicio:

• Un archivo de configuración — la confirmación individual más sólida sería una configuración al estilo Nemotron-H que enumere tipos de capa GDN-2 en un patrón de anulación híbrido. Hasta que exista un config.json como ese, todo es una inferencia a partir de una frase.

• Soporte del motor para un checkpoint específico — los kernels de GDN-2 ya existen; lo que no existe es ningún motor que afirme servir a un híbrido GDN-2 con nombre propio. El cierre de esa brecha es la verdadera señal.

• Un cambio de licencia — este es fácil de pasar por alto. El código de referencia de Gated DeltaNet-2 se publica bajo la NVIDIA Source Code License-NC, que es no comercial, mientras que los pesos del modelo Nemotron se distribuyen bajo la NVIDIA Nemotron Open Model License, que no lo es. Un híbrido que combinara los dos tendría que resolver esa tensión, y cómo la resuelva te dice si el resultado es un artefacto de investigación o algo que podrías desplegar.

Dos cosas falsearían el planteamiento que se hace aquí. Si el «3B» del nombre resulta significar algo distinto de los parámetros totales —parámetros activos, un número de capas o simplemente un nombre en clave—, la economía cambia por completo. Y si la expresión «MoE latente» resulta describir un bloque MoE corriente, entonces esto es una idea mucho más pequeña de lo que parece: un Nano recortado con una capa lineal distinta, no una nueva forma.

Preguntas que esto plantea

¿En qué se diferencia Gated DeltaNet-2 del Gated DeltaNet que ya está dentro de Qwen3.8?

El Gated DeltaNet anterior usa una única puerta escalar tanto para el borrado como para la escritura; Gated DeltaNet-2 la divide en dos puertas por canal y añade un decaimiento por canal tomado de Kimi Delta Attention. Por lo tanto, es una generalización estricta más que un reemplazo, y la diferencia práctica se manifiesta en la recuperación, no en la perplejidad — la brecha en multi-key needle-in-a-haystack es mucho más amplia que la brecha en WikiText.

¿Por qué alguien cambiaría Mamba-2 por GDN-2 en lugar de simplemente lanzar más capas de Mamba-2?

Porque, con un tamaño de estado recurrente igualado, el artículo sitúa a Gated DeltaNet-2 por delante en las tareas de recuperación que realmente ejercitan las cargas de trabajo agénticas de contexto largo, a costa de una pequeña sobrecarga constante en el rendimiento. Si tu carga de trabajo tiene un uso intensivo de recuperación, ese intercambio es favorable; si está limitada por el rendimiento en contexto corto, la línea base Mamba-2 es la respuesta más barata. Un banco de pruebas de 3B es una forma sensata de averiguar a cuál de los dos se parece tu tráfico.

¿El estatus de código abierto de las piezas significa que el modelo también sería abierto?

No. Los pesos de Nemotron-3 Nano están abiertos y el código de referencia de Gated DeltaNet-2 es público, pero ninguno de esos hechos obliga a nadie a publicar un checkpoint construido a partir de ellos — y la licencia no comercial del código de GDN-2 significa que un lanzamiento comercial necesitaría un acuerdo diferente. Los resultados plausibles van desde un lanzamiento de investigación de NVIDIA bajo la Licencia de Modelo Abierto de Nemotron hasta algo que nunca sale de un clúster interno.

¿Hay algo que probar hoy?

Sí, pero no GDN-2-3B. Los checkpoints del artículo Gated DeltaNet-2 son reproducibles desde el repositorio de NVlabs a 1.3B en FineWeb-Edu, y Nemotron-3 Nano 30B-A3B y 4B se ejecutan hoy en vLLM, SGLang, TensorRT-LLM y llama.cpp. Probar cualquiera de las dos mitades te dice lo que probablemente haría la otra, lo cual es más de lo que te da el tuit.

Nada de esto hace que GDN-2-3B sea real. Lo vuelve falsable, que es lo máximo que puede ofrecer una sola frase: estar a un archivo de configuración, una afirmación sobre el motor o un repositorio de ser ya sea un lanzamiento genuino a corto plazo o una recombinación que suena plausible y que nunca llega a construirse.