Главная титульная карточка с заголовком «GDN-2-3B» и подзаголовком «Гибрид Nemotron-3 Nano, в котором Mamba-2 заменён на Gated DeltaNet-2 — один твит, без весов», три статусных чипа с надписями «не выпущено», «единственный источник» и «нет бенчмарков», а также строка в футере «Непроверенный релиз-кандидат, упомянутый в единственном посте X от 2026-09-26». Логотип OrcaRouter в правом нижнем углу.
Guides & Insights

Утечка GDN-2-3B: гибрид Nemotron-3 Nano с Gated DeltaNet-2 вместо Mamba-2

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Одно предложение, опубликованное в X 26 сентября 2026 года, — это вся публичная информация о GDN-2-3B на данный момент. Аккаунт @teortaxesTex написал, что «один из ближайших кандидатов на релиз — это гибридный латентный MoE GDN-2-3B, который следует архитектуре Nemotron-3 Nano, но заменяет слои Mamba-2 на GDN-2». Вот и всё — ни репозитория на Hugging Face, ни файла конфигурации, ни таблицы параметров, ни названного разработчика, ни даты. GDN-2-3B не был выпущен, и ничто ниже не следует читать так, будто он уже выпущен. Что всё же делает эту фразу достойной разбора, так это то, что обе её половины называют нечто реальное и проверяемое: Gated DeltaNet-2 — это опубликованная NVIDIA архитектура линейного внимания с публичной реализацией на PyTorch и активной работой по портированию через инструментарий TPU, Triton и ONNX, а Nemotron-3 Nano — это выпущенный NVIDIA гибрид Mamba-2 с открытыми весами, к которому прививают модель, о которой ходят слухи. Это материал в жанре «что нам известно на данный момент»: архитектура задокументирована, модель — слух, а разница между этими двумя вещами — это и есть вся суть.

Кратко: Gated DeltaNet-2 меняет то, как модель линейного внимания редактирует свою сжатую память, а её измеренные улучшения сильнее всего проявляются именно на задаче извлечения информации в длинном контексте, ради которой и приобретают небольшую гибридную модель. Nemotron-3 Nano — это самый младший уровень в текущем гибридном семействе NVIDIA и тот, который с наибольшей вероятностью будет переработан с использованием более дешёвой рекуррентности. Сложите это вместе — и получите правдоподобного кандидата на релиз, и ровно одного человека, который так говорит.

Что твит говорит, а что — нет

Вчитайтесь в это предложение, потому что оно одновременно необычно плотное и необычно скудное. В нём говорится, что кандидат — это гибрид (то есть больше одного типа слоёв), 3B (количество параметров, достаточно малое, чтобы запускаться на одной потребительской GPU), и латентный MoE (архитектура NVIDIA с маршрутизацией экспертов, в которой токены проецируются в меньшую латентную размерность до того, как они достигнут экспертов; именно это используют уровни Super 120B и Ultra 550B, а поставляемый уровень Nano — нет). В нём говорится, что схема слоёв повторяет Nemotron-3 Nano. И в нём говорится, что слои Mamba-2 заменены на GDN-2.

Чего в нём не сказано: кто это создаёт. В фразе «Один ближайший релиз-кандидат» не назван субъект действия. Так и тянет увидеть в этом NVIDIA: GDN-2 — это исследование NVIDIA, а Nemotron-3 Nano — модель NVIDIA, так что эта пара выглядит как внутренний эксперимент. Но в твите этого не говорится, и третья сторона может уже сегодня легально объединить эти два компонента, потому что веса Nemotron-3 Nano открыты, а эталонный код Gated DeltaNet-2 находится в открытом доступе. Считайте создателя неизвестным.

И не сказано, когда. «Ближайший срок» — единственный сигнал о сроках, и это не дата. Нет чекпоинта для скачивания, нет движка инференса, который заявлял бы, что обслуживает её, и нигде нет бенчмарка самой модели. Каждая цифра в этой статье принадлежит Gated DeltaNet-2 или Nemotron-3 Nano согласно отдельным публикациям. Ни одна из них не принадлежит GDN-2-3B.

Две половины имени, и почему они подходят друг другу

Gated DeltaNet-2 за одну минуту

Линейное внимание заменяет неограниченный KV-кэш softmax-внимания рекуррентным состоянием фиксированного размера. Самое сложное — не решить, что забыть, а редактировать это состояние, не разрушая ассоциации, которые уже в нём хранятся. Модели с дельта-правилом вычитают текущее чтение перед записью нового значения; Kimi Delta Attention обострил забывание с помощью поканального затухания. Однако оба подхода всё ещё управляют двумя разными решениями с помощью одного скалярного гейта: сколько старого содержимого стирать на стороне ключей и сколько нового содержимого записывать на стороне значений.

Gated DeltaNet-2, опубликованный исследователями NVIDIA Али Хатамизаде, Йеджин Чхве и Яном Каутцем (arXiv 2605.22791, эталонный код в репозитории NVlabs), разделяет этот скаляр на два поканальных гейта — гейт стирания над координатами со стороны ключей и гейт записи над координатами со стороны значений — и сохраняет поканальное затухание. В статье говорится, что эта конструкция строго обобщает всё, что было раньше: сведите оба гейта к одному и тому же скаляру — и вы получите Kimi Delta Attention; уберите также затухание — и вы получите более ранний Gated DeltaNet. В абляционном исследовании NVIDIA сообщает, что гейт стирания обеспечивает большую часть прироста, что соответствует его роли в защите ассоциаций со стороны ключей от перезаписи.

Доказательство — это исследование с согласованными параметрами, а не продукт: каждая модель обучена при 1,3 млрд параметров на 100 млрд токенов FineWeb-Edu, при этом размер рекуррентного состояния одинаков для Mamba-2, Gated DeltaNet, KDA и Mamba-3. В рекуррентном режиме Gated DeltaNet-2 показывает лучшую в группе перплексию WikiText — 15,90 против 16,79 у Mamba-2 — и лучшую среднюю точность на задачах здравого смысла — 53,11 против 52,39 у Mamba-3. В гибридном режиме — том, который действительно напоминает чередующийся шаблон Nemotron-3 Nano — это 15,62 перплексии WikiText и 53,97 средней точности, что опережает Mamba-3 (15,81 / 52,72) и значительно опережает обычный базовый Transformer (19,22 / 50,86).

То, где концентрируется преимущество, — это та часть, которая важна для небольшой модели с длинным контекстом. В рекуррентном тесте RULER на поиск иголки в стоге сена с несколькими ключами при 4K Gated DeltaNet-2 набирает 37.8 против 27.8 у более старой Gated DeltaNet и 28.0 у KDA; в тесте с одной иголкой при 2K она набирает 89.8 против 54.2. В среднем по шести реальным наборам для извлечения (SWDE, SQuAD, FDA, TriviaQA, NQ, DROP) она лидирует в рекуррентном фронтире с 29.88 против 26.84 у Mamba-2, и в гибридном фронтире с 42.28 против 40.14 у KDA. NVIDIA также сообщает о почти плоском масштабировании пропускной способности с длиной последовательности на одном H100, с лишь небольшими постоянными накладными расходами по сравнению с KDA из-за дополнительных гейтов. Это данные производителя из собственных таблиц статьи, не воспроизведённые нами.

Two-column comparison scoreboard titled 'Mamba-2 vs Gated DeltaNet-2 - the scoreboard'. Left column 'Mamba-2': Decay scalar; Erase gate none; Write gate scalar; WikiText ppl 16.79; LMB ppl 12.38; Retrieval avg 26.84. Right column 'Gated DeltaNet-2': Decay channel-wise; Erase gate channel-wise b; Write gate channel-wise w; WikiText ppl 15.90; LMB ppl 11.41; Retrieval avg 29.88. Footer: both recurrent-only, 1.3B params, 100B FineWeb-Edu tokens, figures per NVIDIA's Gated DeltaNet-2 paper, not independently reproduced. OrcaRouter logo bottom-right.

Схема Nemotron-3 Nano

Nemotron-3 Nano — это гибрид Mamba-Transformer на основе Mixture-of-Experts, и заимствуется именно архитектура, а не модель. Релиз 30B-A3B имеет 52 слоя: 23 слоя Mamba-2, 23 слоя MoE и шесть слоев grouped-query attention, с 128 маршрутизируемыми экспертами плюс один общий эксперт на блок MoE и шесть активных экспертов на токен. Он обладает 3,5 млрд активных параметров при 30 млрд общих, был предварительно обучен на 25 триллионах токенов и поддерживает контекстные окна до 1 млн токенов; собственный технический отчет NVIDIA утверждает о до 3,3-кратном повышении пропускной способности инференса по сравнению с открытыми моделями аналогичного размера, такими как GPT-OSS-20B и Qwen3-30B-A3B-Thinking-2507. Он выпущен под лицензией NVIDIA Nemotron Open Model License и явно разрешен для коммерческого использования.

Есть меньший собрат, о котором стоит знать, потому что «3B» в предполагаемом названии оказывается близко к нему: Nemotron-3 Nano 4B, сжатая из NVIDIA-Nemotron-Nano-9B-v2 с помощью фреймворка NVIDIA Elastic, представляет собой «в основном слои Mamba-2 и MLP в сочетании всего с четырьмя слоями Attention». Так что сегмент Nano — это уже та часть семейства, которую сжимают и перекраивают. Это единственная и наиболее правдоподобная причина, по которой экспериментальный вариант 3B вообще мог бы существовать.

Два несоответствия стоит отметить, а не сглаживать. Во-первых, в поставляемом семействе именно старшие уровни — Nemotron-3 Super 120B-A12B и Nemotron-3 Ultra 550B-A55B — используют латентный MoE; уровень Nano — нет. Таким образом, «латентный MoE в форме Nano» — это не прямой перенос существующей конфигурации NVIDIA, а рекомбинация идей двух уровней, и именно такое обычно появляется в исследовательских чекпоинтах раньше, чем в продукте. Во-вторых, блоки MoE семейства Nano используют маршрутизацию к плотным экспертам; переход к латентной маршрутизации меняет профиль FLOP каждого слоя экспертов, поэтому метка 3B мало что скажет о том, во сколько на самом деле обходится обслуживание модели, пока не появится файл конфигурации.

След портирования реален — модель нет.

То, что можно проверить, — это то, что Gated DeltaNet-2 быстро встраивается в продакшн-рантаймы. 23 сентября 2026 года пул-реквест в репозиторий Tokamax проекта OpenXLA добавил Pallas-ядро и оператор Gated Delta Net 2 для TPU, включая обратный проход autograd по шести входам и результаты бенчмарков на Cloud TPU v7x. В Flash Linear Attention слитые ядра предзаполнения GDN-2 присутствуют с конца июня — тамошний пул-реквест сообщает о среднем ускорении предзаполнения в 2,48 раза и лучшем результате в 5,13 раза на H100 — а последующие доработки в сентябре исправили ошибку порядка гейтов и оптимизировали путь обучения по чанкам. В ONNX зарегистрирован открытый пробел в спецификации, потому что оператор LinearAttention из opset 27 не может выразить поканальный стирающий гейт GDN-2. А собственный Megatron-Bridge от NVIDIA в марте добавил учёт FLOPs как для гибридных слоёв GDN, так и для сжатия latent-MoE.

Ничто из этого не является релизом модели, и было бы ошибкой считать это таковым. Работа над ядрами — это инфраструктура; она говорит о том, что архитектуру воспринимают всерьёз, а не о том, что существует чекпоинт. Что она действительно даёт — так это конкретную вещь для отслеживания: если гибрид GDN-2 всё же увидит свет, он появится сначала в виде поддержки, добавленной в serving-движок, а уже потом в виде анонса, и поддержка в движке уже частично реализована. Работа над Tokamax и Flash Linear Attention — это также сильнейший аргумент в пользу того, что сочетание в твите технически согласовано, а не выдумано, — компоненты, необходимые для обслуживания гибрида GDN-2, создаются людьми, которые не являются автором твита.

Screenshot of the NVlabs/GatedDeltaNet-2 GitHub repository page in English: the title 'Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention', the file list with README.md, LICENSE, SECURITY.md and lit_gpt/scripts directories, and the About panel showing 317 stars, 33 forks and a last commit from last month.

Почему гибрид GDN-2 с 3B будет иметь значение, если выйдет

Целесообразность этой комбинации диктуется экономикой, а не бенчмарками. Гибрид класса 3B с рекуррентным состоянием фиксированного размера — это модель, которую можно запустить на одной потребительской GPU без KV-кэша, растущего вместе с промптом; ровно та же сделка, на которую уже идёт Nemotron-3 Nano 4B. Замена слоёв Mamba-2 на GDN-2, судя по цифрам из статьи, даёт лучшее извлечение по нескольким ключам и лучшие средние показатели извлечения в реальных условиях при сопоставимом размере состояния — именно те две области, где старое семейство с дельта-правилом было слабее всего. Это точечное обновление, а не смена поколения, и именно такое изменение стоило бы 3B параметров.

Это также напоминание о том, что интересная конкуренция среди малых моделей сместилась с количества параметров на проектирование памяти. 3B-модель, рекуррентное состояние которой — фиксированный тензор, при длинных промптах ведёт себя иначе, чем 3B-трансформер с квантованным KV-кэшем: память не растёт, но у модели есть фиксированный бюджет на то, что она может запомнить, и теперь именно то, насколько изящно она забывает, является определяющей характеристикой. Весь вклад Gated DeltaNet-2 — это улучшенное правило забывания. Поэтому это архитектура, за которой стоит следить как за самостоятельным решением, даже если GDN-2-3B никогда не появится под этим именем.

Как бы вы на самом деле протестировали что-то подобное

Когда непроверенная архитектура добирается до сервирующего рантайма, для большинства команд камнем преткновения становится не таблица бенчмарков — а то, что её внедрение означает новую интеграцию, новый контракт и новый режим отказа, и всё это против модели без продакшен-истории. Это проблема маршрутизации раньше, чем проблема модели. Агрегатор, который ставит новую конечную точку за тот же ключ, которым вы уже пользуетесь, означает, что вы можете направить на неё часть реального трафика, оставить свою существующую модель в качестве фолбэка и позволить автоматическому переключению при сбое перехватывать ошибки, пока новый маршрут ещё нестабилен — один API для 200+ моделей по прайс-листовой цене провайдера с наценкой 0%, так что цена, которую вам назвали, — это цена, которую вы платите, и скидка от вендора отражается в тот же день, а не в следующем счёте. Сам GDN-2-3B нигде не хостится — ни нами, ни кем-либо ещё; вот что значит «невыпущенный». Суть в том паттерне, который вы примените в тот день, когда он выйдет.

Если вы хотите увидеть, какие гибридные модели и модели с длинным контекстом доступны для маршрутизации сегодня, живой каталог моделей — это честный список: в нём отмечено то, что действительно можно обслуживать, а не то, что было анонсировано.

Screenshot of the OrcaRouter model catalogue at orcarouter.ai/models, headline '204 models - 16 providers - one API key, one bill', with the filter rail for input modalities, context length, input price, status and series, the Models / Leaderboard / Offers / playground tabs, and a 'How to call any model' panel.

За чем следить и что могло бы это опровергнуть

Утечка разрешается одним из трёх способов, и у каждого есть свой признак:

• Файл конфигурации — единственным наиболее убедительным подтверждением была бы конфигурация в стиле Nemotron-H, перечисляющая типы слоёв GDN-2 в шаблоне гибридного переопределения. Пока такого config.json не существует, всё — лишь вывод из одного предложения.

• Поддержка конкретного чекпоинта на уровне движка — ядра GDN-2 уже существуют; чего не существует — так это движка, заявляющего о поддержке именованного гибрида GDN-2. Именно закрытие этого пробела и есть настоящий сигнал.

• Смена лицензии — такое легко упустить. Эталонный код Gated DeltaNet-2 выпущен под NVIDIA Source Code License-NC, которая является некоммерческой, тогда как веса моделей Nemotron поставляются под NVIDIA Nemotron Open Model License, которая таковой не является. Гибрид, объединивший эти два, должен был бы как-то разрешить это противоречие, и то, как он его разрешает, говорит о том, является ли результат исследовательским артефактом или чем-то, что можно развернуть.

Две вещи опровергли бы эту трактовку. Если «3B» в названии окажется означающим что-то иное, чем общее число параметров — активные параметры, число слоёв или просто кодовое имя, — экономика полностью меняется. А если фраза «латентный MoE» окажется описанием обычного блока MoE, то это гораздо более скромная идея, чем кажется: перекрой Nano с другим линейным слоем, а не новая форма.

Вопросы, которые это вызывает

Чем Gated DeltaNet-2 отличается от Gated DeltaNet, уже встроенного в Qwen3.8?

Более ранняя Gated DeltaNet использует единый скалярный гейт как для стирания, так и для записи; Gated DeltaNet-2 разделяет его на два поканальных гейта и добавляет поканальное затухание, заимствованное из Kimi Delta Attention. Таким образом, это строгое обобщение, а не замена, и практическая разница проявляется в извлечении информации, а не в перплексии — разрыв в многоключевой задаче «игла в стоге сена» гораздо шире, чем разрыв на WikiText.

Почему кто-то стал бы менять Mamba-2 на GDN-2, вместо того чтобы просто выпускать больше слоёв Mamba-2?

Поскольку при сопоставимом размере рекуррентного состояния в статье Gated DeltaNet-2 показывает лучшие результаты на задачах поиска информации, которые реально задействуют агентные рабочие нагрузки с длинным контекстом, ценой небольших постоянных накладных расходов на пропускную способность. Если ваша рабочая нагрузка ориентирована на поиск информации, такой компромисс выгоден; если она ограничена пропускной способностью при коротком контексте, базовая модель Mamba-2 — более дешёвое решение. Тестовый стенд на 3B — разумный способ выяснить, на что больше похож ваш трафик.

Означает ли статус открытого исходного кода этих компонентов, что модель тоже будет открытой?

Нет. Веса Nemotron-3 Nano открыты, а эталонный код Gated DeltaNet-2 находится в открытом доступе, но ни один из этих фактов не обязывает кого-либо публиковать чекпойнт, созданный на их основе, — и некоммерческая лицензия на код GDN-2 означает, что для коммерческого релиза потребовалась бы иная договорённость. Вероятные исходы варьируются от исследовательского релиза NVIDIA под лицензией Nemotron Open Model License до чего-то, что никогда не покинет внутренний кластер.

Есть что-нибудь, что можно попробовать сегодня?

Да, но не GDN-2-3B. Чекпоинты статьи Gated DeltaNet-2 воспроизводимы из репозитория NVlabs в масштабе 1,3B на FineWeb-Edu, а Nemotron-3 Nano 30B-A3B и 4B уже сегодня работают на vLLM, SGLang, TensorRT-LLM и llama.cpp. Тестирование любой из половин говорит о том, что, вероятно, сделала бы другая половина, — и это больше, чем даёт твит.

Ничто из этого не делает GDN-2-3B реальным. Оно делает его опровержимым — а это максимум, что может дать одно предложение: всего один конфигурационный файл, одно заявление о движке или один репозиторий отделяет его от того, чтобы стать либо подлинным релизом в ближайшем будущем, либо правдоподобно звучащей рекомбинацией, которая так и не будет реализована.