Thẻ tiêu đề hero có tiêu đề chính là 'GDN-2-3B' với phụ đề 'Một hybrid Nemotron-3 Nano với Mamba-2 được thay bằng Gated DeltaNet-2 — một tweet, không có trọng số', ba chip trạng thái ghi 'chưa phát hành', 'một nguồn' và 'không có benchmark', cùng một dòng chân trang 'Ứng viên phát hành chưa được xác minh được nêu tên trong một bài đăng X duy nhất vào ngày 2026-09-26.' Logo OrcaRouter ở góc dưới cùng bên phải.
Guides & Insights

Rò rỉ GDN-2-3B: một mô hình lai Nemotron-3 Nano dùng Gated DeltaNet-2 thay cho Mamba-2

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Một câu duy nhất đăng trên X vào ngày 26 tháng 9 năm 2026 là toàn bộ hồ sơ công khai của GDN-2-3B tính đến nay. Tài khoản @teortaxesTex viết rằng "một ứng viên phát hành trong ngắn hạn là mô hình MoE tiềm ẩn lai GDN-2-3B, mô hình này tuân theo kiến trúc Nemotron-3 Nano nhưng thay thế các lớp Mamba-2 bằng GDN-2." Chỉ có vậy — không có kho Hugging Face, không có tệp cấu hình, không có bảng tham số, không có đơn vị xây dựng nào được nêu tên, không có ngày. GDN-2-3B chưa được phát hành, và không nên đọc bất cứ điều gì dưới đây như thể nó đã được phát hành. Điều khiến dòng đó vẫn đáng để mổ xẻ là cả hai nửa của nó đều nêu tên một thứ có thật và có thể kiểm chứng: Gated DeltaNet-2 là một kiến trúc attention tuyến tính do NVIDIA công bố, với bản triển khai PyTorch công khai và một chuỗi chuyển đổi nhộn nhịp qua các công cụ TPU, Triton và ONNX, còn Nemotron-3 Nano là mô hình lai Mamba-2 trọng số mở đã phát hành của NVIDIA mà mô hình được đồn đại đang được ghép lên. Đây là một bài tổng hợp những gì đã biết đến nay: kiến trúc đã được ghi chép, mô hình là một tin đồn, và sự khác biệt giữa hai điều đó chính là toàn bộ câu chuyện.

Bản ngắn gọn: Gated DeltaNet-2 thay đổi cách một mô hình attention tuyến tính chỉnh sửa bộ nhớ nén của nó, và những mức cải thiện đo được của nó thể hiện rõ nhất đúng ở phần việc truy xuất ngữ cảnh dài mà một mô hình lai nhỏ được mua để đảm nhiệm. Nemotron-3 Nano là phân khúc nhỏ nhất trong dòng mô hình lai hiện tại của NVIDIA và là mô hình có khả năng cao nhất được cắt lại với một cơ chế tái lặp rẻ hơn. Ghép những điều đó lại, bạn có một ứng viên phát hành đáng tin — và đúng một người nói như vậy.

Những gì tweet nói và không nói

Hãy đọc kỹ câu này, vì nó vừa dày đặc một cách bất thường vừa mỏng một cách bất thường cùng lúc. Nó cho biết ứng viên này là hybrid (tức là có nhiều hơn một loại lớp), 3B (một số lượng tham số đủ nhỏ để chạy trên một GPU tiêu dùng), và một MoE tiềm ẩn (một thiết kế định tuyến chuyên gia của NVIDIA, trong đó các token được chiếu vào một chiều tiềm ẩn nhỏ hơn trước khi chúng đến các chuyên gia, đây là thiết kế mà các phiên bản Super 120B và Ultra 550B sử dụng còn phiên bản Nano đã phát hành thì không). Nó nói rằng kiểu lớp tuân theo Nemotron-3 Nano. Và nó nói rằng các lớp Mamba-2 được thay thế bằng GDN-2.

Điều mà nó không nói: ai đang xây dựng nó. “One near-term release candidate” không có chủ ngữ. Thật dễ để gán NVIDIA vào đó — GDN-2 là nghiên cứu của NVIDIA và Nemotron-3 Nano là một mô hình của NVIDIA, nên sự kết hợp này trông giống như một thí nghiệm nội bộ — nhưng dòng tweet không nói như vậy, và một bên thứ ba có thể kết hợp hai thứ đó một cách hợp pháp ngay hôm nay, vì trọng số của Nemotron-3 Nano là mở và mã tham chiếu của Gated DeltaNet-2 là công khai. Hãy coi người xây dựng là không rõ.

Nó cũng không nói khi nào. “Ngắn hạn” là tín hiệu thời gian duy nhất, và đó không phải là một mốc ngày. Không có checkpoint nào để tải xuống, không có engine suy luận nào tuyên bố phục vụ nó, và không có benchmark nào của chính mô hình đó ở bất cứ đâu. Mọi số liệu trong bài viết này đều thuộc về Gated DeltaNet-2 hoặc Nemotron-3 Nano như được công bố riêng. Không số liệu nào trong đó thuộc về GDN-2-3B.

Hai nửa của cái tên, và vì sao chúng phù hợp với nhau

Gated DeltaNet-2 trong một phút

Attention tuyến tính thay thế KV cache không giới hạn của softmax attention bằng một trạng thái hồi tiếp có kích thước cố định. Phần khó không nằm ở việc quyết định quên gì — mà là chỉnh sửa trạng thái đó mà không làm xáo trộn những liên kết vốn đã được lưu trong đó. Các mô hình Delta-rule trừ đi giá trị đọc hiện tại trước khi ghi một giá trị mới; Kimi Delta Attention làm sắc nét việc quên bằng suy giảm theo kênh. Tuy nhiên, cả hai vẫn điều khiển hai quyết định khác nhau từ một cổng vô hướng: xóa bao nhiêu nội dung cũ ở phía key, và cam kết bao nhiêu nội dung mới ở phía value.

Gated DeltaNet-2, được công bố bởi các nhà nghiên cứu NVIDIA Ali Hatamizadeh, Yejin Choi và Jan Kautz (arXiv 2605.22791, mã tham chiếu trong kho lưu trữ NVlabs), tách giá trị vô hướng đó thành hai cổng theo kênh — một cổng xóa trên các tọa độ phía khóa và một cổng ghi trên các tọa độ phía giá trị — và giữ nguyên suy giảm theo kênh. Cách đặt vấn đề của bài báo là thiết kế này tổng quát hóa một cách chặt chẽ những gì đã có trước đó: gộp cả hai cổng về cùng một giá trị vô hướng và bạn thu được Kimi Delta Attention; gộp cả suy giảm nữa và bạn thu được Gated DeltaNet trước đó. Trong phần ablation, NVIDIA báo cáo rằng cổng xóa chiếm phần lớn mức cải thiện, điều này phù hợp với vai trò của nó trong việc bảo vệ các liên kết phía khóa khỏi bị ghi đè.

Bằng chứng là một nghiên cứu khớp tham số, không phải một sản phẩm: mọi mô hình đều được huấn luyện ở 1,3B tham số trên 100B token FineWeb-Edu, với kích thước trạng thái hồi tiếp được giữ bằng nhau giữa Mamba-2, Gated DeltaNet, KDA và Mamba-3. Trong thiết lập hồi tiếp, Gated DeltaNet-2 đạt perplexity WikiText tốt nhất trong nhóm ở mức 15,90 so với 16,79 của Mamba-2, và độ chính xác trung bình trên các tác vụ thường thức tốt nhất ở mức 53,11 so với 52,39 của Mamba-3. Trong thiết lập lai — thiết lập thực sự giống với kiểu xen kẽ của Nemotron-3 Nano — nó đạt 15,62 perplexity WikiText và 53,97 độ chính xác trung bình, vượt Mamba-3 (15,81 / 52,72) và vượt xa mô hình cơ sở Transformer thuần (19,22 / 50,86).

Nơi lợi thế tập trung mới là phần quan trọng đối với một mô hình ngữ cảnh dài cỡ nhỏ. Trên bài kiểm tra multi-key needle-in-a-haystack hồi tiếp của RULER ở 4K, Gated DeltaNet-2 đạt 37,8 so với 27,8 của Gated DeltaNet đời cũ hơn và 28,0 của KDA; ở single-needle tại 2K, nó đạt 89,8 so với 54,2. Tính trung bình trên sáu bộ truy xuất thực tế (SWDE, SQuAD, FDA, TriviaQA, NQ, DROP), nó dẫn đầu nhóm mô hình hồi tiếp với 29,88 so với 26,84 của Mamba-2, và dẫn đầu nhóm mô hình lai với 42,28 so với 40,14 của KDA. NVIDIA cũng báo cáo khả năng mở rộng thông lượng gần như phẳng theo độ dài chuỗi trên một H100 duy nhất, chỉ với một chi phí cố định nhỏ so với KDA cho các cổng bổ sung. Đây là các số liệu của nhà cung cấp từ chính các bảng trong bài báo, chưa được chúng tôi tái lập.

Two-column comparison scoreboard titled 'Mamba-2 vs Gated DeltaNet-2 - the scoreboard'. Left column 'Mamba-2': Decay scalar; Erase gate none; Write gate scalar; WikiText ppl 16.79; LMB ppl 12.38; Retrieval avg 26.84. Right column 'Gated DeltaNet-2': Decay channel-wise; Erase gate channel-wise b; Write gate channel-wise w; WikiText ppl 15.90; LMB ppl 11.41; Retrieval avg 29.88. Footer: both recurrent-only, 1.3B params, 100B FineWeb-Edu tokens, figures per NVIDIA's Gated DeltaNet-2 paper, not independently reproduced. OrcaRouter logo bottom-right.

Bản thiết kế Nemotron-3 Nano

Nemotron-3 Nano là kiến trúc hybrid Mamba-Transformer Mixture-of-Experts, và thứ được mượn ở đây là kiến trúc chứ không phải mô hình. Bản phát hành 30B-A3B có 52 lớp: 23 lớp Mamba-2, 23 lớp MoE và sáu lớp attention truy vấn theo nhóm, với 128 expert được định tuyến cùng một expert chia sẻ cho mỗi khối MoE và sáu expert hoạt động trên mỗi token. Nó có 3,5B tham số hoạt động so với tổng 30B, được tiền huấn luyện trên 25 nghìn tỷ token và hỗ trợ cửa sổ ngữ cảnh lên tới 1M token; báo cáo kỹ thuật của chính NVIDIA tuyên bố thông lượng suy luận cao hơn tới 3,3 lần so với các mô hình mở có kích thước tương đương như GPT-OSS-20B và Qwen3-30B-A3B-Thinking-2507. Nó được phát hành theo Giấy phép Mô hình Mở NVIDIA Nemotron và được cho phép rõ ràng cho mục đích thương mại.

Có một người em nhỏ hơn đáng để biết đến, vì “3B” trong cái tên được đồn đại nằm gần với nó: Nemotron-3 Nano 4B, được nén từ NVIDIA-Nemotron-Nano-9B-v2 bằng framework Elastic của NVIDIA, “chủ yếu là các lớp Mamba-2 và MLP kết hợp với chỉ bốn lớp Attention”. Vậy nên tầng Nano vốn đã là phần của dòng họ bị ép nén và cắt lại. Đó là lý do khả dĩ nhất để một biến thể thử nghiệm 3B lại tồn tại.

Có hai điểm không khớp đáng để nêu ra hơn là xoa dịu cho qua. Thứ nhất, trong dòng sản phẩm đã phát hành, chính các tier lớn — Nemotron-3 Super 120B-A12B và Nemotron-3 Ultra 550B-A55B — mới sử dụng latent MoE; tier Nano thì không. Do đó, một "latent MoE có hình dạng Nano" không phải là bản chuyển thẳng từ cấu hình NVIDIA hiện có, mà là sự tái kết hợp ý tưởng của hai tier, đúng kiểu điều thường xuất hiện trong các checkpoint nghiên cứu trước khi xuất hiện trong một sản phẩm. Thứ hai, các khối MoE của dòng Nano được định tuyến theo dense-expert; việc chuyển sang định tuyến latent làm thay đổi hồ sơ FLOP của mọi lớp expert, nên một nhãn 3B sẽ cho bạn biết rất ít về chi phí thực tế để phục vụ mô hình cho đến khi một tệp cấu hình xuất hiện.

Dấu vết porting là thật — mô hình thì không.

Điều có thể xác minh là Gated DeltaNet-2 đang được đưa vào các runtime production với tốc độ nhanh. Vào ngày 23 tháng 9 năm 2026, một pull request đến kho Tokamax của OpenXLA đã thêm kernel và toán tử Pallas cho Gated Delta Net 2 dành cho TPU, bao gồm một lượt lan truyền ngược autograd qua sáu đầu vào và các số benchmark trên Cloud TPU v7x. Flash Linear Attention đã có các kernel prefill hợp nhất GDN-2 từ cuối tháng 6 — pull request ở đó báo cáo mức tăng tốc prefill trung bình 2,48x và trường hợp tốt nhất 5,13x trên H100 — với các cập nhật tiếp theo vào tháng 9 sửa lỗi thứ tự cổng và tối ưu hóa đường huấn luyện theo chunk. ONNX có một lỗ hổng đặc tả đang mở được ghi nhận đối với nó, vì toán tử LinearAttention của opset 27 không thể biểu diễn cổng xóa theo kênh của GDN-2. Và Megatron-Bridge của chính NVIDIA đã bổ sung việc tính toán FLOPs cho cả các lớp GDN lai và nén latent-MoE vào tháng 3.

Không có điều nào trong số đó là một bản phát hành mô hình, và sẽ là sai lầm nếu đọc nó như vậy. Công việc kernel là hạ tầng; nó nói rằng một kiến trúc đang được xem trọng, chứ không phải rằng đã tồn tại một checkpoint. Điều nó mang lại cho bạn là một thứ cụ thể để theo dõi: nếu một hybrid GDN-2 thực sự ra đời, nó sẽ xuất hiện trước tiên dưới dạng hỗ trợ được đưa vào một serving engine, và thứ hai mới là một thông báo, mà phần hỗ trợ trong engine thì đã có sẵn một phần. Công trình Tokamax và Flash Linear Attention cũng là lập luận mạnh nhất cho thấy sự ghép cặp trong tweet là mạch lạc về mặt kỹ thuật chứ không phải bịa ra — những thành phần cần thiết để phục vụ một hybrid GDN-2 đang được xây dựng bởi những người không phải là tác giả của tweet.

Screenshot of the NVlabs/GatedDeltaNet-2 GitHub repository page in English: the title 'Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention', the file list with README.md, LICENSE, SECURITY.md and lit_gpt/scripts directories, and the About panel showing 317 stars, 33 forks and a last commit from last month.

Tại sao một hybrid GDN-2 3B lại quan trọng nếu nó được phát hành

Lập luận ủng hộ sự kết hợp này mang tính kinh tế chứ không phải dựa trên benchmark. Một mô hình hybrid lớp 3B với trạng thái hồi tiếp kích thước cố định là mô hình bạn có thể chạy trên một GPU tiêu dùng mà không cần KV cache tăng theo độ dài prompt — cũng chính là sự đánh đổi mà Nemotron-3 Nano 4B đã thực hiện. Việc thay các lớp Mamba-2 bằng GDN-2 mang lại, theo các con số trong bài báo, khả năng truy xuất đa khóa tốt hơn và điểm trung bình truy xuất trong thực tế tốt hơn ở cùng kích thước trạng thái — hai điểm mà họ delta-rule cũ yếu nhất. Đó là một nâng cấp có mục tiêu, không phải nâng cấp theo thế hệ, và đây là kiểu thay đổi đáng giá 3B tham số.

Đó cũng là một lời nhắc rằng cuộc cạnh tranh đáng chú ý trong các mô hình nhỏ đã chuyển từ số lượng tham số sang thiết kế bộ nhớ. Một mô hình 3B có trạng thái hồi tiếp là một tensor cố định sẽ hành xử khác dưới các prompt dài so với một transformer 3B với KV cache được lượng tử hóa: bộ nhớ là phẳng, nhưng mô hình có một ngân sách cố định cho những gì nó có thể ghi nhớ, và việc nó quên một cách uyển chuyển như thế nào giờ đây chính là đặc tả. Toàn bộ đóng góp của Gated DeltaNet-2 là một quy tắc quên tốt hơn. Điều đó khiến nó trở thành một thiết kế đáng theo dõi theo đúng tiêu chí của riêng nó, ngay cả khi GDN-2-3B không bao giờ xuất hiện dưới cái tên đó.

Bạn sẽ thực sự kiểm thử một thứ như thế này như thế nào

Khi một kiến trúc chưa được chứng minh chạm đến runtime phục vụ, rào cản đối với hầu hết các đội không phải là bảng benchmark — mà là việc áp dụng nó đồng nghĩa với một tích hợp mới, một hợp đồng mới và một kiểu lỗi mới, tất cả đều dựa trên một mô hình chưa từng có lịch sử vận hành thực tế. Đó là bài toán định tuyến trước khi là bài toán mô hình. Một aggregator đặt endpoint mới nằm sau đúng key bạn đang dùng nghĩa là bạn có thể gửi một phần lưu lượng thật tới nó, giữ mô hình hiện tại làm phương án dự phòng, và để tự động chuyển đổi dự phòng bắt lấy các lỗi trong khi tuyến mới vẫn còn chưa ổn định — một API duy nhất cho hơn 200 mô hình ở mức giá niêm yết của nhà cung cấp với markup 0%, nên mức giá bạn được báo chính là mức giá bạn trả và việc nhà cung cấp giảm giá sẽ hiển thị ngay trong ngày thay vì đợi đến hóa đơn kế tiếp. Bản thân GDN-2-3B không được host ở bất kỳ đâu, bởi chúng tôi hay bất kỳ ai khác; đó chính là ý nghĩa của "unreleased". Điểm mấu chốt nằm ở mô thức bạn sẽ dùng vào đúng ngày nó ra mắt.

Nếu bạn muốn xem những mô hình hybrid và ngữ cảnh dài nào có thể định tuyến được ngay hôm nay, thìdanh mục mô hình trực tuyến chính là danh sách trung thực — nó đánh dấu những gì thực sự có thể phục vụ chứ không phải những gì đã được công bố.

Screenshot of the OrcaRouter model catalogue at orcarouter.ai/models, headline '204 models - 16 providers - one API key, one bill', with the filter rail for input modalities, context length, input price, status and series, the Models / Leaderboard / Offers / playground tabs, and a 'How to call any model' panel.

Những gì cần theo dõi, và điều gì sẽ phủ định điều này

Vụ rò rỉ được giải quyết theo một trong ba cách, và mỗi cách đều có dấu hiệu nhận biết:

• Một tệp cấu hình — xác nhận mạnh nhất duy nhất sẽ là một cấu hình kiểu Nemotron-H liệt kê các loại lớp GDN-2 trong một mẫu ghi đè lai. Cho đến khi một config.json như vậy tồn tại, mọi thứ đều là suy luận từ một câu.

• Engine hỗ trợ cho một checkpoint cụ thể — các kernel GDN-2 đã tồn tại; điều chưa tồn tại là bất kỳ engine nào tuyên bố phục vụ một mô hình hybrid GDN-2 có tên cụ thể. Việc khoảng trống đó được lấp đầy mới chính là tín hiệu thực sự.

• Thay đổi giấy phép — điểm này dễ bị bỏ sót. Mã tham chiếu Gated DeltaNet-2 được phát hành theo NVIDIA Source Code License-NC, vốn là giấy phép phi thương mại, trong khi trọng số mô hình Nemotron được cung cấp theo NVIDIA Nemotron Open Model License, vốn không phải phi thương mại. Một mô hình lai kết hợp cả hai sẽ phải giải quyết mâu thuẫn đó, và cách nó giải quyết sẽ cho bạn biết kết quả là một sản phẩm nghiên cứu hay một thứ bạn có thể triển khai.

Hai điều sẽ bác bỏ cách đặt vấn đề ở đây. Nếu chữ "3B" trong tên hóa ra có nghĩa khác với tổng số tham số — tham số hoạt động, hoặc số lớp, hoặc chỉ đơn thuần là một mật danh — thì bài toán kinh tế thay đổi hoàn toàn. Và nếu cụm "latent MoE" hóa ra chỉ mô tả một khối MoE thông thường, thì đây là một ý tưởng nhỏ hơn nhiều so với vẻ ngoài của nó: một bản Nano được cắt lại với một lớp tuyến tính khác, chứ không phải một hình dạng mới.

Những câu hỏi mà điều này đặt ra

Gated DeltaNet-2 khác gì so với Gated DeltaNet đã có sẵn trong Qwen3.8?

Phiên bản Gated DeltaNet trước đó sử dụng một cổng vô hướng duy nhất cho cả việc xóa lẫn ghi; Gated DeltaNet-2 tách nó thành hai cổng theo kênh và bổ sung cơ chế suy giảm theo kênh vay mượn từ Kimi Delta Attention. Vì vậy, nó là một dạng tổng quát hóa chặt chẽ hơn thay vì một sự thay thế, và khác biệt thực tế thể hiện ở truy hồi, chứ không phải ở perplexity — khoảng cách trên multi-key needle-in-a-haystack rộng hơn hẳn so với khoảng cách trên WikiText.

Tại sao ai đó lại đổi Mamba-2 sang GDN-2 thay vì chỉ triển khai thêm nhiều lớp Mamba-2?

Bởi vì ở cùng kích thước trạng thái hồi tiếp, bài báo đo được Gated DeltaNet-2 nhỉnh hơn trên các tác vụ truy xuất mà khối lượng công việc agentic ngữ cảnh dài thực sự vận hành, đổi lại chỉ tốn thêm một chi phí cố định nhỏ về thông lượng. Nếu khối lượng công việc của bạn thiên về truy xuất, sự đánh đổi đó là có lợi; nếu nó bị giới hạn bởi thông lượng ở ngữ cảnh ngắn, thì baseline Mamba-2 là câu trả lời rẻ hơn. Một testbed 3B là cách hợp lý để tìm ra xem lưu lượng của bạn giống loại nào.

Việc các thành phần là mã nguồn mở có nghĩa là mô hình cũng sẽ mở không?

Không. Trọng số của Nemotron-3 Nano là mở và mã tham chiếu của Gated DeltaNet-2 là công khai, nhưng không điều nào trong hai sự thật đó buộc bất kỳ ai phải công bố một checkpoint được xây dựng từ chúng — và giấy phép phi thương mại trên mã GDN-2 nghĩa là một bản phát hành thương mại sẽ cần một thỏa thuận khác. Những kết cục khả dĩ trải từ một bản phát hành nghiên cứu của NVIDIA theo Nemotron Open Model License cho đến một thứ không bao giờ rời khỏi cụm nội bộ.

Hôm nay có gì để thử không?

Đúng, nhưng không phải GDN-2-3B. Các checkpoint của bài báo Gated DeltaNet-2 có thể tái lập từ kho NVlabs ở mức 1.3B trên FineWeb-Edu, và Nemotron-3 Nano 30B-A3B cùng 4B chạy trên vLLM, SGLang, TensorRT-LLM và llama.cpp ngay hôm nay. Kiểm thử một nửa nào cũng cho bạn biết nửa còn lại có khả năng sẽ làm gì — điều đó còn hơn cả những gì dòng tweet mang lại.

Không điều nào trong số này khiến GDN-2-3B trở thành hiện thực. Nó khiến nó có thể bị phản bác, đó là điều tối đa mà một câu duy nhất có thể mang lại: chỉ cách một tệp cấu hình, một tuyên bố về engine, hoặc một kho lưu trữ để trở thành hoặc là một bản phát hành thực sự trong ngắn hạn, hoặc là một sự tái tổ hợp nghe có vẻ hợp lý nhưng không bao giờ được xây dựng.