제목이 'GDN-2-3B'이고 부제가 'Mamba-2를 Gated DeltaNet-2로 교체한 Nemotron-3 Nano 하이브리드 - 트윗 하나, 가중치 없음'인 히어로 타이틀 카드, '미출시', '단일 출처', '벤치마크 없음'이라고 적힌 세 개의 상태 칩, 그리고 '2026-09-26에 올라온 단일 X 게시물에서 이름이 언급된 미검증 릴리스 후보.'라는 하단 줄. 오른쪽 아래에 OrcaRouter 로고.
Guides & Insights

GDN-2-3B 유출: Mamba-2 대신 Gated DeltaNet-2를 적용한 Nemotron-3 Nano 하이브리드

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

2026년 9월 26일 X에 게시된 단 한 문장이 GDN-2-3B에 대해 지금까지 공개된 전체 기록이다. @teortaxesTex 계정은 "가까운 시일 내 릴리스 후보 중 하나는 하이브리드 GDN-2-3B latent MoE로, Nemotron-3 Nano 아키텍처를 따르지만 Mamba-2 레이어를 GDN-2로 대체한다"고 썼다. 그게 전부다 — Hugging Face 저장소도, 구성 파일도, 파라미터 표도, 이름 붙은 빌더도, 날짜도 없다. GDN-2-3B는 출시되지 않았으며, 아래의 어떤 내용도 출시된 것처럼 읽어서는 안 된다. 그럼에도 이 문장을 풀어볼 가치가 있는 이유는, 이 문장의 두 부분 모두 실제로 확인 가능한 무언가를 지칭한다는 점이다: Gated DeltaNet-2는 NVIDIA가 공개한 선형 어텐션 아키텍처로, 공개 PyTorch 구현과 TPU, Triton, ONNX 도구 전반에 걸친 활발한 포팅 이력을 갖고 있으며, Nemotron-3 Nano는 NVIDIA가 출시한 오픈 웨이트 Mamba-2 하이브리드로, 소문난 모델이 접목되는 대상이다. 이 글은 지금까지 알려진 내용을 정리한 글이다: 아키텍처는 문서화되어 있고, 모델은 소문이며, 이 둘 사이의 차이가 바로 이 이야기의 전부다.

간단히 말하면: Gated DeltaNet-2는 선형 어텐션 모델의 압축 메모리 편집 방식을 바꾼다. 그리고 그 측정된 이득은 소형 하이브리드를 구매하는 바로 그 긴 문맥 검색 작업에서 가장 강하게 나타난다. Nemotron-3 Nano는 NVIDIA의 현재 하이브리드 제품군에서 가장 작은 등급이며, 더 저렴한 재귀 구조로 다시 구성될 가능성이 가장 큰 모델이다. 이것들을 종합하면 그럴듯한 출시 후보가 나온다 — 그리고 그렇게 말하는 사람은 정확히 한 명뿐이다.

트윗이 말하는 것과 말하지 않는 것

문장을 자세히 읽어 보세요. 이 문장은 동시에 유난히 밀도가 높으면서도 유난히 빈약하기 때문입니다. 이 문장은 후보가 다음과 같다고 말합니다: 하이브리드 (즉, 하나 이상의 레이어 유형), 3B (소비자용 GPU 한 장에서 실행할 수 있을 만큼 작은 파라미터 수), 그리고 잠재 MoE (토큰이 전문가에게 도달하기 전에 더 작은 잠재 차원으로 투영되는 NVIDIA의 전문가 라우팅 설계로, 이는 Super 120B와 Ultra 550B 티어가 사용하는 방식이며 출시된 Nano 티어는 사용하지 않는 방식입니다). 이 문장은 레이어 패턴이 Nemotron-3 Nano를 따른다고 말합니다. 그리고 Mamba-2 레이어가 GDN-2로 대체된다고 말합니다.

말하지 않는 것: 누가 그것을 만들고 있는지. "단기 출시 후보 하나"에는 주어가 없다. 여기에 NVIDIA를 읽어 넣고 싶어지지만 — GDN-2는 NVIDIA 연구이고 Nemotron-3 Nano는 NVIDIA 모델이라서 이 조합은 사내 실험처럼 보인다 — 트윗은 그렇게 말하지 않으며, 제3자가 오늘 이 둘을 합법적으로 결합할 수 있다. Nemotron-3 Nano 가중치는 공개되어 있고 Gated DeltaNet-2 참조 코드도 공개되어 있기 때문이다. 만든 주체는 알 수 없는 것으로 간주하라.

언제인지도 말하지 않는다. "근시일 내"가 유일한 시점 신호이며, 그것은 날짜가 아니다. 다운로드할 체크포인트도 없고, 그것을 서빙한다고 주장하는 추론 엔진도 없으며, 모델 자체에 대한 벤치마크도 어디에도 없다. 이 글의 모든 수치는 별도로 공개된 Gated DeltaNet-2나 Nemotron-3 Nano에 속한다. 그중 어느 것도 GDN-2-3B에 속하지 않는다.

이름의 두 부분, 그리고 그것이 잘 맞는 이유

1분 만에 보는 Gated DeltaNet-2

선형 어텐션은 소프트맥스 어텐션의 무한정 커질 수 있는 KV 캐시를 고정 크기 순환 상태로 대체한다. 어려운 부분은 무엇을 잊을지 결정하는 것이 아니라, 그 상태에 이미 저장된 연관들을 뒤섞지 않으면서 그 상태를 편집하는 것이다. 델타 규칙 모델들은 새 값을 쓰기 전에 현재 읽어낸 값을 빼낸다; Kimi Delta Attention은 채널별 감쇠로 망각을 더 예리하게 만들었다. 하지만 둘 다 여전히 하나의 스칼라 게이트로 두 가지 서로 다른 결정을 내린다: 키 측에서 얼마나 많은 오래된 내용을 지울지, 그리고 값 측에서 얼마나 많은 새 내용을 기록할지.

NVIDIA 연구진 Ali Hatamizadeh, Yejin Choi, Jan Kautz가 공개한 Gated DeltaNet-2(arXiv 2605.22791, NVlabs 저장소의 참조 코드)는 그 스칼라를 두 개의 채널별 게이트 — 키 측 좌표에 대한 erase gate와 값 측 좌표에 대한 write gate — 로 나누고, 채널별 감쇠를 유지한다. 논문의 프레이밍은 이 설계가 이전의 것을 엄밀히 일반화한다는 것이다. 두 게이트를 동일한 스칼라로 축소하면 Kimi Delta Attention을 복원할 수 있고, 감쇠까지 축소하면 이전의 Gated DeltaNet을 복원할 수 있다. 소거 실험에서 NVIDIA는 erase gate가 이득의 대부분을 차지한다고 보고하는데, 이는 키 측 연관이 덮어써지지 않도록 보호하는 역할과 부합한다.

증거는 제품이 아니라 매개변수를 맞춘 연구다: 모든 모델은 1.3B 매개변수로 100B FineWeb-Edu 토큰에서 훈련되었고, 순환 상태 크기는 Mamba-2, Gated DeltaNet, KDA 및 Mamba-3 전반에서 동일하게 유지되었다. 순환 설정에서 Gated DeltaNet-2는 그룹 내 최고 WikiText 퍼플렉서티인 15.90을 기록하며 Mamba-2의 16.79를 앞섰고, 최고 평균 상식 정확도 53.11로 Mamba-3의 52.39를 앞섰다. 하이브리드 설정 — 실제로 Nemotron-3 Nano의 인터리브 패턴과 닮은 설정 — 에서는 15.62 WikiText 퍼플렉서티와 53.97 평균 정확도로, Mamba-3(15.81 / 52.72)를 앞서고 일반 Transformer 기준선(19.22 / 50.86)을 훨씬 앞선다.

장점이 집중되는 지점이 소규모 장문맥 모델에서 중요한 부분이다. RULER의 4K 반복 다중 키 건초더미 속 바늘 찾기 테스트에서 Gated DeltaNet-2는 37.8점으로 구형 Gated DeltaNet의 27.8점, KDA의 28.0점을 앞선다. 2K 단일 바늘 테스트에서는 89.8점으로 54.2점을 앞선다. 여섯 개의 실제 검색 데이터셋(SWDE, SQuAD, FDA, TriviaQA, NQ, DROP) 평균에서 재귀 모델군 최전선에서는 29.88로 Mamba-2의 26.84를 앞서고, 하이브리드 모델군 최전선에서는 42.28로 KDA의 40.14를 앞선다. NVIDIA는 또한 단일 H100에서 시퀀스 길이에 따라 거의 평탄한 처리량 확장성을 보고하며, 추가 게이트로 인한 KDA 대비 상수 오버헤드는 작다. 이는 논문 자체 표에 실린 벤더 수치이며, 우리가 재현한 것이 아니다.

Two-column comparison scoreboard titled 'Mamba-2 vs Gated DeltaNet-2 - the scoreboard'. Left column 'Mamba-2': Decay scalar; Erase gate none; Write gate scalar; WikiText ppl 16.79; LMB ppl 12.38; Retrieval avg 26.84. Right column 'Gated DeltaNet-2': Decay channel-wise; Erase gate channel-wise b; Write gate channel-wise w; WikiText ppl 15.90; LMB ppl 11.41; Retrieval avg 29.88. Footer: both recurrent-only, 1.3B params, 100B FineWeb-Edu tokens, figures per NVIDIA's Gated DeltaNet-2 paper, not independently reproduced. OrcaRouter logo bottom-right.

Nemotron-3 Nano 블루프린트

Nemotron-3 Nano는 Mixture-of-Experts 하이브리드 Mamba-Transformer이며, 차용되는 것은 모델이 아니라 이 아키텍처입니다. 30B-A3B 릴리스는 52개 레이어로 구성됩니다: 23개의 Mamba-2 레이어, 23개의 MoE 레이어, 6개의 그룹화된 쿼리 어텐션 레이어이며, MoE 블록마다 128개의 라우팅된 전문가에 더해 1개의 공유 전문가가 있고 토큰당 6개의 전문가가 활성화됩니다. 총 30B 대비 3.5B의 활성 파라미터를 가지며, 25조 토큰으로 사전 학습되었고 최대 1M 토큰의 컨텍스트 윈도우를 지원합니다. NVIDIA 자체 기술 보고서에서는 GPT-OSS-20B 및 Qwen3-30B-A3B-Thinking-2507과 같은 유사 규모의 오픈 모델보다 최대 3.3배 높은 추론 처리량을 주장합니다. NVIDIA Nemotron Open Model License에 따라 릴리스되었으며 상업적 사용이 명시적으로 허용됩니다.

알아 둘 만한 더 작은 형제 모델이 있다. 소문난 이름 속 "3B"가 그것에 가깝기 때문이다: NVIDIA-Nemotron-Nano-9B-v2에서 NVIDIA의 Elastic 프레임워크를 사용해 압축한 Nemotron-3 Nano 4B는 "주로 Mamba-2와 MLP 계층에 단 네 개의 Attention 계층만 결합한 것"이다. 그래서 Nano 등급은 이미 이 제품군에서 압축되고 다시 잘려 나가는 부분이다. 3B 실험적 변형이 애초에 존재할 가장 그럴듯한 단 하나의 이유가 바로 이것이다.

두 가지 불일치는 무마하기보다 문제로 짚어둘 가치가 있다. 첫째, 출시된 패밀리에서는 대형 티어가 — Nemotron-3 Super 120B-A12B 및 Nemotron-3 Ultra 550B-A55B — 잠재 MoE를 사용한다; Nano 티어는 그렇지 않다. 따라서 "Nano 형태의 잠재 MoE"는 기존 NVIDIA 구성에서 그대로 이식한 것이 아니라 두 티어의 아이디어를 재조합한 것이며, 이는 제품에 나타나기 전에 연구 체크포인트에 먼저 나타나는 바로 그런 종류의 것이다. 둘째, Nano 패밀리의 MoE 블록은 dense-expert 방식으로 라우팅된다; 잠재 라우팅으로 전환하면 모든 전문가 레이어의 FLOP 프로파일이 바뀌므로, 구성 파일이 나오기 전까지는 3B라는 라벨이 그 모델을 실제로 서빙하는 데 드는 비용에 대해 거의 알려주지 못할 것이다.

포팅 흔적은 진짜다 — 모델은 아니다

검증할 수 있는 것은 Gated DeltaNet-2가 빠른 속도로 프로덕션 런타임에 맞춰지고 있다는 점이다. 2026년 9월 23일, OpenXLA의 Tokamax 저장소에 대한 풀 리퀘스트가 TPU용 Gated Delta Net 2 Pallas 커널과 연산자를 추가했으며, 여기에는 6개 입력에 걸친 autograd 역방향 패스와 Cloud TPU v7x의 벤치마크 수치가 포함된다. Flash Linear Attention은 지난 6월 말부터 융합된 GDN-2 prefill 커널을 제공해 왔는데, 그곳의 풀 리퀘스트는 H100에서 평균 2.48배의 prefill 속도 향상과 최대 5.13배의 사례를 보고했으며, 9월의 후속 작업에서는 게이트 순서 버그를 수정하고 청크 훈련 경로를 최적화했다. ONNX에는 이에 대한 미해결 사양 격차가 제기되어 있는데, opset 27의 LinearAttention 연산자가 GDN-2의 채널별 erase gate를 표현할 수 없기 때문이다. 그리고 NVIDIA 자체의 Megatron-Bridge는 3월에 하이브리드 GDN 레이어와 latent-MoE 압축 모두에 대한 FLOPs 계산을 추가했다.

그중 어느 것도 모델 릴리스가 아니며, 그것을 그렇게 읽는 것은 실수일 것이다. 커널 작업은 인프라다. 그것은 어떤 아키텍처가 진지하게 다뤄지고 있다는 뜻이지, 체크포인트가 존재한다는 뜻은 아니다. 그것이 실제로 주는 것은 구체적으로 지켜볼 대상이다. GDN-2 하이브리드가 정말로 세상에 나온다면, 그것은 먼저 서빙 엔진에 지원이 들어오는 형태로 도착하고, 그다음에 발표로 도착할 것이다. 그리고 엔진 지원은 이미 부분적으로 마련되어 있다. Tokamax와 Flash Linear Attention 작업은 또한 트윗에 나온 그 조합이 지어낸 것이 아니라 기술적으로 일관성이 있다는 가장 강력한 근거다. GDN-2 하이브리드를 서빙하는 데 필요한 조각들은 트윗을 쓴 사람이 아닌 사람들에 의해 만들어지고 있다.

Screenshot of the NVlabs/GatedDeltaNet-2 GitHub repository page in English: the title 'Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention', the file list with README.md, LICENSE, SECURITY.md and lit_gpt/scripts directories, and the About panel showing 317 stars, 33 forks and a last commit from last month.

3B GDN-2 하이브리드가 출시된다면 왜 중요한가

이 조합의 근거는 벤치마크가 아니라 경제성에 있다. 고정 크기 순환 상태를 갖춘 3B급 하이브리드는 프롬프트에 따라 커지는 KV 캐시 없이 소비자용 GPU 한 대에서 실행할 수 있는 모델이며, 이는 Nemotron-3 Nano 4B가 이미 하는 것과 같은 거래다. 논문 수치상 Mamba-2 레이어를 GDN-2로 바꾸면 동일한 상태 크기에서 더 나은 멀티키 검색과 더 나은 실제 환경 검색 평균을 얻을 수 있다 — 이는 기존 델타 규칙 계열이 가장 취약했던 두 지점이다. 이는 세대적 업그레이드가 아니라 표적형 업그레이드이며, 3B 파라미터만큼의 가치가 있을 법한 종류의 변화다.

이는 또한 소형 모델에서의 흥미로운 경쟁이 파라미터 수에서 메모리 설계로 옮겨갔다는 점을 상기시켜 준다. 순환 상태가 고정 텐서인 3B 모델은 양자화된 KV 캐시를 사용하는 3B 트랜스포머와 긴 프롬프트에서 다르게 동작한다: 메모리는 평평하지만, 모델이 기억할 수 있는 것에는 고정된 예산이 있고, 얼마나 우아하게 잊는지가 이제 사양이다. Gated DeltaNet-2의 전체 기여는 더 나은 망각 규칙이다. 그렇기에 GDN-2-3B가 그 이름으로 결코 등장하지 않더라도, 그 자체의 관점에서 주목할 가치가 있는 설계다.

이런 걸 실제로 어떻게 테스트할지

검증되지 않은 아키텍처가 서빙 런타임에 도달했을 때, 대부분의 팀에게 걸림돌은 벤치마크 표가 아니라 — 그것은 이 아키텍처를 도입한다는 것이 새 통합, 새 계약, 새 실패 모드를 의미하며, 그 모두가 프로덕션 이력이 없는 모델을 상대로 이뤄진다는 점입니다. 이는 모델 문제이기 전에 라우팅 문제입니다. 새 엔드포인트를 이미 사용 중인 동일한 키 뒤에 두는 애그리게이터를 사용하면 실제 트래픽의 일부를 그쪽으로 보내고, 기존 모델은 폴백으로 유지할 수 있으며, 자동 페일오버가 새 경로가 아직 불안정한 동안 오류를 잡아내도록 할 수 있습니다 — 200개 이상의 모델을 아우르는 하나의 API를 공급자 정가로, 0% 마크업으로, 따라서 견적받은 가격이 지불하는 가격이고 공급업체의 가격 인하가 다음 청구서가 아니라 같은 날 반영됩니다. GDN-2-3B 자체는 우리든 다른 누구든 어디에도 호스팅되지 않습니다. 그것이 "미출시"의 의미입니다. 핵심은 그것이 출시되는 날 여러분이 사용하게 될 패턴입니다.

오늘날 어떤 하이브리드 및 장문맥 모델을 라우팅할 수 있는지 확인하고 싶다면, 실시간 모델 카탈로그가 정직한 목록입니다 — 발표된 것이 아니라 실제로 서비스 가능한 것을 표시합니다.

Screenshot of the OrcaRouter model catalogue at orcarouter.ai/models, headline '204 models - 16 providers - one API key, one bill', with the filter rail for input modalities, context length, input price, status and series, the Models / Leaderboard / Offers / playground tabs, and a 'How to call any model' panel.

무엇을 지켜봐야 하는가, 그리고 무엇이 이것을 반증할 수 있는가

유출은 세 가지 방식 중 하나로 해결되며, 각각에는 단서가 있습니다:

• 구성 파일 — 가장 강력한 확인은 하이브리드 재정의 패턴으로 GDN-2 레이어 유형을 나열한 Nemotron-H 스타일 구성일 것입니다. 그러한 config.json이 존재하기 전까지는 모든 것이 한 문장에서 비롯된 추론일 뿐입니다.

• 특정 체크포인트에 대한 엔진 지원 — GDN-2 커널은 이미 존재합니다; 존재하지 않는 것은 이름이 지정된 GDN-2 하이브리드를 서빙한다고 주장하는 엔진입니다. 그 격차가 해소되는 것이 진짜 신호입니다.

• 라이선스 변경 — 이건 놓치기 쉽다. Gated DeltaNet-2 참조 코드는 비상업용인 NVIDIA Source Code License-NC에 따라 공개되는 반면, Nemotron 모델 가중치는 NVIDIA Nemotron Open Model License로 배포되는데, 이는 비상업용이 아니다. 둘을 결합한 하이브리드라면 그 긴장을 해소해야 할 터인데, 그것을 어떻게 해소하느냐에 따라 결과물이 연구용 산출물인지 배포할 수 있는 것인지가 드러난다.

여기서 이 프레이밍을 반증할 수 있는 두 가지가 있습니다. 이름의 "3B"가 전체 파라미터가 아닌 다른 것 — 활성 파라미터, 레이어 수, 아니면 단순히 코드명 — 을 의미하는 것으로 드러나면, 경제성은 완전히 달라집니다. 그리고 "latent MoE"라는 표현이 평범한 MoE 블록을 설명하는 것으로 드러나면, 이것은 겉보기보다 훨씬 작은 아이디어입니다: 새로운 형태가 아니라, 다른 선형 레이어로 다시 잘라낸 Nano입니다.

이것이 제기하는 질문들

Gated DeltaNet-2는 Qwen3.8에 이미 들어 있는 Gated DeltaNet과 어떻게 다른가요?

초기 Gated DeltaNet은 지우기와 쓰기 모두에 단일 스칼라 게이트를 사용하지만, Gated DeltaNet-2는 이를 두 개의 채널별 게이트로 분리하고 Kimi Delta Attention에서 차용한 채널별 감쇠를 추가한다. 따라서 이는 대체가 아니라 엄격한 일반화이며, 실질적인 차이는 퍼플렉서티가 아니라 검색에서 드러난다 — 멀티 키 needle-in-a-haystack에서의 격차는 WikiText에서의 격차보다 훨씬 크다.

그냥 Mamba-2 레이어를 더 넣는 대신에, 왜 Mamba-2를 GDN-2로 바꾸겠는가?

동일한 순환 상태 크기에서 이 논문은 Gated DeltaNet-2가 장문맥 에이전트 워크로드가 실제로 수행하는 검색 작업에서 앞선다고 측정하며, 그 대가로 처리량에 작은 상수 오버헤드가 발생한다. 워크로드가 검색 비중이 높다면 그 트레이드오프는 유리하다; 짧은 컨텍스트에서 처리량에 병목이 있다면 Mamba-2 베이스라인이 더 저렴한 답이다. 3B 테스트베드는 여러분의 트래픽이 어느 쪽에 가까운지 알아내는 합리적인 방법이다.

구성 요소들의 오픈소스 상태가 모델도 오픈소스라는 것을 의미하나요?

아니요. Nemotron-3 Nano의 가중치는 공개되어 있고 Gated DeltaNet-2의 참조 코드도 공개되어 있지만, 그 어느 사실도 그것들로 구축된 체크포인트를 공개할 의무를 누구에게도 부과하지 않는다. — 그리고 GDN-2 코드에 적용된 비상업적 라이선스는 상업적 릴리스에 별도의 합의가 필요하다는 뜻이다. 가능성 있는 결과들은 Nemotron Open Model License에 따른 NVIDIA의 연구용 릴리스부터 내부 클러스터를 결코 벗어나지 않는 무언가까지 다양하다.

오늘 시도해 볼 만한 게 있나요?

네, 하지만 GDN-2-3B는 아닙니다. Gated DeltaNet-2 논문의 체크포인트는 NVlabs 리포지토리에서 FineWeb-Edu 기반 1.3B로 재현할 수 있고, Nemotron-3 Nano 30B-A3B와 4B는 오늘 vLLM, SGLang, TensorRT-LLM, llama.cpp에서 실행됩니다. 어느 한쪽을 테스트하면 다른 쪽이 아마 어떻게 작동할지 알 수 있습니다 — 이는 그 트윗이 알려주는 것보다 더 많은 정보입니다.

이 중 어느 것도 GDN-2-3B를 실제로 존재하게 만들지는 않는다. 그것은 GDN-2-3B를 반증 가능하게 만들 뿐이고, 그게 한 문장이 줄 수 있는 최대치다: 설정 파일 하나, 엔진 주장 하나, 저장소 하나만 더 있으면 진정한 근시일 출시가 되거나, 그럴듯하게 들리지만 결코 만들어지지 않을 재조합이 될 수 있는 상태인 것이다.