بطاقة عنوان رئيسية بعنوان 'GDN-2-3B' مع عنوان فرعي 'هجين Nemotron-3 Nano مع استبدال Mamba-2 بـ Gated DeltaNet-2 - تغريدة واحدة، بلا أوزان'، وثلاث شرائح حالة تحمل النصوص 'غير مُصدَر'، 'مصدر واحد' و'بلا اختبارات أداء'، وسطر تذييل 'مرشح إصدار غير موثّق ورد اسمه في منشور X واحد بتاريخ 2026-09-26.' شعار OrcaRouter أسفل اليمين.
Guides & Insights

تسريب GDN-2-3B: هجين Nemotron-3 Nano مع Gated DeltaNet-2 بدلاً من Mamba-2

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

جملة واحدة نُشرت على X في 26 سبتمبر 2026 هي السجل العام الكامل لـ GDN-2-3B حتى الآن. كتب حساب @teortaxesTex أن "أحد المرشحين للإصدار على المدى القريب هو GDN-2-3B latent MoE الهجين، الذي يتبع بنية Nemotron-3 Nano لكنه يستبدل طبقات Mamba-2 بـ GDN-2." هذا كل شيء — لا مستودع Hugging Face، ولا ملف إعداد، ولا جدول معاملات، ولا منشئ مسمّى، ولا تاريخ. لم يُصدر GDN-2-3B، ولا ينبغي قراءة أي شيء أدناه كما لو كان قد صدر. ما يجعل السطر جديرًا بالتفكيك على أي حال هو أن كلا نصفيه يسمّي شيئًا حقيقيًا وقابلًا للتحقق: Gated DeltaNet-2 هو بنية انتباه خطي منشورة من NVIDIA مع تطبيق PyTorch عام ومسار نقل مزدحم عبر أدوات TPU وTriton وONNX، و Nemotron-3 Nano هو هجين Mamba-2 مفتوح الأوزان الذي شحنته NVIDIA والذي يُطعَّم عليه النموذج المزعوم. هذه مقالة من نوع «ما نعرفه حتى الآن»: البنية موثقة، والنموذج مجرد شائعة، والفرق بين هذين الأمرين هو القصة كاملة.

النسخة المختصرة: يغيّر Gated DeltaNet-2 الطريقة التي يعدّل بها نموذج انتباه خطي ذاكرته المضغوطة، وتقع مكاسبه المقيسة بأقصى قوة على عمل الاسترجاع الطويل السياق تحديدًا الذي يُشترى من أجله هجين صغير. Nemotron-3 Nano هو أصغر فئة في عائلة NVIDIA الهجينة الحالية، وهو الأكثر ترجيحًا لإعادة تشكيله بتكرار أرخص. اجمع هذين معًا فتحصل على مرشح إصدار محتمل — وشخص واحد بالضبط يقول ذلك.

ما تقوله التغريدة وما لا تقوله

اقرأ الجملة بتمعّن، لأنها كثيفة بشكل غير معتاد ورقيقة بشكل غير معتاد في الوقت نفسه. تقول إن المرشّح هو هجين (أي أكثر من نوع واحد من الطبقات)، 3B (عدد معاملات صغير بما يكفي للتشغيل على وحدة معالجة رسومات استهلاكية واحدة)، وMoE كامن (تصميم لتوجيه الخبراء من NVIDIA تُحوَّل فيه الرموز إلى بُعد كامن أصغر قبل أن تصل إلى الخبراء، وهو ما تستخدمه فئتا Super 120B و Ultra 550B وما لا تفعله فئة Nano المُصدَرة). وتقول إن نمط الطبقات يتبع Nemotron-3 Nano. وتقول إن طبقات Mamba-2 مُستبدَلة بـ GDN-2.

ما لا تقوله: مَن يبنيه. عبارة «مرشّح إصدار قريب الأجل» لا فاعل لها. من المغري أن نقرأ NVIDIA في ذلك — فـ GDN-2 بحث لـ NVIDIA وNemotron-3 Nano نموذج لـ NVIDIA، لذا يبدو هذا الاقتران كتجربة داخلية — لكن التغريدة لا تقول ذلك، ويمكن لطرف ثالث أن يجمع بين الاثنين قانونيًا اليوم، لأن أوزان Nemotron-3 Nano مفتوحة والشيفرة المرجعية لـ Gated DeltaNet-2 عامة. اعتبر الباني مجهولًا.

ولا يذكر متى أيضًا. «المدى القريب» هو الإشارة الزمنية الوحيدة، وهو ليس تاريخًا. لا توجد نقطة تحقق لتنزيلها، ولا محرك استدلال يدّعي تقديمه، ولا أي اختبار مرجعي للنموذج نفسه في أي مكان. كل رقم في هذه المقالة يخص Gated DeltaNet-2 أو Nemotron-3 Nano كما نُشر كل منهما على حدة. ولا يخص أي منها GDN-2-3B.

نصفا الاسم، ولماذا يتلاءمان

Gated DeltaNet-2 في دقيقة واحدة

يستبدل الانتباه الخطي ذاكرة KV غير المحدودة في انتباه softmax بحالة تكرارية ثابتة الحجم. الجزء الصعب ليس تحديد ما يجب نسيانه — بل تحرير تلك الحالة دون إرباك الارتباطات المخزنة فيها بالفعل. تطرح نماذج قاعدة دلتا القراءة الحالية قبل كتابة قيمة جديدة؛ وقد عزّز Kimi Delta Attention النسيان باضمحلال على مستوى القنوات. غير أن كليهما لا يزال يقود قرارين مختلفين انطلاقًا من بوابة قياسية واحدة: مقدار المحتوى القديم الذي يجب محوه على جانب المفتاح، ومقدار المحتوى الجديد الذي يجب تثبيته على جانب القيمة.

Gated DeltaNet-2، الذي نشره باحثو NVIDIA علي حاتميزاده، وييجين تشوي، وجان كاوتز (arXiv 2605.22791، الكود المرجعي في مستودع NVlabs)، يقسم ذلك العدد القياسي إلى بوابتين على مستوى القناة — بوابة محو على إحداثيات جانب المفتاح وبوابة كتابة على إحداثيات جانب القيمة — ويحافظ على الاضمحلال على مستوى القناة. إطار الورقة هو أن التصميم يعمم بشكل صارم ما سبق: إذا طويت كلتا البوابتين إلى نفس العدد القياسي، فستستعيد Kimi Delta Attention؛ وإذا طويت الاضمحلال أيضًا، فستستعيد Gated DeltaNet الأسبق. في تجارب الاستئصال، ذكرت NVIDIA أن بوابة المحو تمثل معظم المكسب، وهو ما يتناسب مع دورها في حماية ارتباطات جانب المفتاح من الكتابة فوقها.

الدليل هو دراسة بمعاملات متطابقة، وليس منتجًا: كل نموذج دُرِّب عند 1.3 مليار معامل على 100 مليار رمز FineWeb-Edu، مع إبقاء حجم الحالة التكرارية متساويًا عبر Mamba-2 وGated DeltaNet وKDA وMamba-3. في الإعداد التكراري، يسجل Gated DeltaNet-2 أفضل درجة حيرة على WikiText في المجموعة عند 15.90 مقابل 16.79 لدى Mamba-2، وأفضل متوسط دقة للحس السليم عند 53.11 مقابل 52.39 لدى Mamba-3. وفي الإعداد الهجين — ذاك الذي يشبه فعليًا النمط المتشابك لدى Nemotron-3 Nano — يبلغ 15.62 لدرجة حيرة WikiText و53.97 لمتوسط الدقة، متقدمًا على Mamba-3 (15.81 / 52.72) ومتقدمًا بفارق كبير على خط أساس Transformer بسيط (19.22 / 50.86).

المكان الذي تتركز فيه الميزة هو الجزء المهم بالنسبة لنموذج صغير ذي سياق طويل. في اختبار RULER المتكرر متعدد المفاتيح "إبرة في كومة قش" عند 4K، يسجل Gated DeltaNet-2 37.8 مقابل 27.8 لـ Gated DeltaNet الأقدم و28.0 لـ KDA؛ وفي اختبار الإبرة الواحدة عند 2K يسجل 89.8 مقابل 54.2. بمتوسط عبر ست مجموعات استرجاع حقيقية (SWDE، SQuAD، FDA، TriviaQA، NQ، DROP) فإنه يتصدر الحدود المتكررة عند 29.88 مقابل 26.84 لـ Mamba-2، والحدود الهجينة عند 42.28 مقابل 40.14 لـ KDA. تذكر NVIDIA أيضًا توسعًا شبه مسطح في الإنتاجية مع طول التسلسل على H100 واحد، مع تكلفة إضافية ثابتة صغيرة فقط فوق KDA بسبب البوابات الإضافية. هذه أرقام المورد من جداول الورقة نفسها، لم نعد إنتاجها.

Two-column comparison scoreboard titled 'Mamba-2 vs Gated DeltaNet-2 - the scoreboard'. Left column 'Mamba-2': Decay scalar; Erase gate none; Write gate scalar; WikiText ppl 16.79; LMB ppl 12.38; Retrieval avg 26.84. Right column 'Gated DeltaNet-2': Decay channel-wise; Erase gate channel-wise b; Write gate channel-wise w; WikiText ppl 15.90; LMB ppl 11.41; Retrieval avg 29.88. Footer: both recurrent-only, 1.3B params, 100B FineWeb-Edu tokens, figures per NVIDIA's Gated DeltaNet-2 paper, not independently reproduced. OrcaRouter logo bottom-right.

مخطط Nemotron-3 Nano

‏Nemotron-3 Nano هو نموذج هجين من نوع Mixture-of-Experts يجمع بين Mamba وTransformer، وهو البنية التي تُستعار وليس النموذج نفسه. إصدار 30B-A3B مؤلّف من 52 طبقة: 23 طبقة Mamba-2، و23 طبقة MoE، وست طبقات انتباه بالاستعلامات المجمّعة (grouped-query attention)، مع 128 خبيرًا موجّهًا بالإضافة إلى خبير مشترك واحد لكل كتلة MoE وستة خبراء نشطين لكل رمز. يحمل 3.5B معامل نشط مقابل 30B إجمالًا، ودُرّب مسبقًا على 25 تريليون رمز، ويدعم نوافذ سياق تصل إلى 1M رمز؛ ويزعم تقرير NVIDIA الفني الخاص به تحقيق إنتاجية استدلال أعلى تصل إلى 3.3x مقارنة بنماذج مفتوحة مماثلة في الحجم مثل GPT-OSS-20B وQwen3-30B-A3B-Thinking-2507. صدر بموجب NVIDIA Nemotron Open Model License، وهو مرخّص صراحةً للاستخدام التجاري.

هناك شقيق أصغر يستحقّ معرفته، لأنّ "3B" في الاسم المُتداول يقترب منه كثيرًا: Nemotron-3 Nano 4B، المضغوط من NVIDIA-Nemotron-Nano-9B-v2 باستخدام إطار Elastic من NVIDIA، هو "بشكل أساسي طبقات Mamba-2 وMLP مدمجة مع أربع طبقات Attention فقط." لذا فإن فئة Nano هي بالفعل الجزء من العائلة الذي يُضغط ويُعاد قطعه. وهذا هو السبب الأكثر ترجيحًا لوجود نسخة تجريبية بحجم 3B أصلًا.

هناك حالتا عدم تطابق تستحقان الإشارة إليهما بدلًا من التغاضي عنهما. أولًا، في العائلة المطروحة، إنها الكبيرة من الفئات — Nemotron-3 Super 120B-A12B وNemotron-3 Ultra 550B-A55B — التي تستخدم MoE الكامن؛ أما فئة Nano فلا. وبالتالي، فإن "MoE الكامن على شكل Nano" ليس نقلًا مباشرًا لإعداد NVIDIA قائم، بل إعادة تركيب لأفكار فئتين، وهو بالضبط النوع من الأمور الذي يظهر في نقاط التفتيش البحثية قبل أن يظهر في منتج. ثانيًا، كتل MoE في عائلة Nano موجَّهة عبر خبراء كثيفين؛ ويؤدي نقل التوجيه الكامن إلى تغيير نمط FLOP لكل طبقة خبير، لذا فإن تسمية 3B لن تخبرك إلا بالقليل جدًا عن التكلفة الفعلية لخدمة النموذج حتى يظهر ملف إعداد.

أثر النقل حقيقي — أما النموذج فليس كذلك

ما يمكن التحقق منه هو أن Gated DeltaNet-2 يجري تركيبه في بيئات التشغيل الإنتاجية بسرعة. في 23 سبتمبر 2026، أضاف طلب سحب إلى مستودع Tokamax التابع لـ OpenXLA نواة ومشغّل Gated Delta Net 2 Pallas لـ TPU، بما في ذلك تمرير خلفي autograd عبر ستة مدخلات وأرقام قياس أداء على Cloud TPU v7x. وقد ضمّ Flash Linear Attention نوى prefill مدمجة لـ GDN-2 منذ أواخر يونيو — ويشير طلب السحب هناك إلى تسريع متوسط قدره 2.48x في prefill، وأفضل حالة 5.13x على H100 — مع متابعات في سبتمبر أصلحت خطأ في ترتيب البوابة وحسّنت مسار تدريب الـ chunk. ولدى ONNX فجوة مواصفات مفتوحة مسجلة ضدها، لأن مشغّل LinearAttention في opset 27 لا يستطيع التعبير عن بوابة المحو على مستوى القناة الخاصة بـ GDN-2. كما أضاف Megatron-Bridge الخاص بـ NVIDIA نفسه محاسبة FLOPs لكل من طبقات GDN الهجينة وضغط latent-MoE في مارس.

لا شيء من ذلك يُعد إصدار نموذج، وسيكون من الخطأ قراءته على هذا النحو. العمل على النواة (Kernel) هو بنية تحتية؛ إنه يقول إن معمارية ما تُؤخذ على محمل الجد، وليس إن نقطة تحقق (checkpoint) موجودة. لكن ما يمنحك إياه هو شيء ملموس يمكن مراقبته: إذا وصل GDN-2 الهجين إلى العالم فعلاً، فسيصل أولاً على هيئة دعم يستقر في محرك خدمة (serving engine)، وثانياً على هيئة إعلان، ودعم المحرك موجود جزئياً بالفعل. كما أن العمل على Tokamax وFlash Linear Attention هو أيضاً أقوى حجة على أن الاقتران الوارد في التغريدة متماسك تقنياً وليس مُختلقاً — فالمكوّنات اللازمة لتشغيل GDN-2 الهجين يبنيها أشخاص ليسوا الشخص الذي كتب التغريدة.

Screenshot of the NVlabs/GatedDeltaNet-2 GitHub repository page in English: the title 'Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention', the file list with README.md, LICENSE, SECURITY.md and lit_gpt/scripts directories, and the About panel showing 317 stars, 33 forks and a last commit from last month.

لماذا قد يهمّ نموذج هجين GDN-2 بحجم 3B إذا تم إطلاقه

الحجة المؤيدة لهذه التركيبة اقتصادية لا مدفوعة بالمعايير القياسية. إن نموذج هجين من فئة 3B بحالة تكرارية ثابتة الحجم هو نموذج يمكنك تشغيله على وحدة معالجة رسومات استهلاكية واحدة دون ذاكرة KV مؤقتة تنمو مع طول الموجّه، وهو نفس المقايضة التي يقدمها Nemotron-3 Nano 4B بالفعل. إن استبدال طبقات Mamba-2 بـ GDN-2 يمنحك، وفق أرقام الورقة البحثية، استرجاعاً أفضل متعدد المفاتيح ومتوسطات استرجاع واقعية أفضل عند حجم حالة مماثل — وهما الموضعان اللذان كانت فيهما عائلة قاعدة دلتا الأقدم أضعف ما تكون. هذه ترقية موجَّهة، لا ترقية جيلية، وهي نوع التغيير الذي يستحق 3B من المعاملات.

وهو أيضًا تذكير بأن المنافسة المثيرة في النماذج الصغيرة قد انتقلت من عدد المعلمات إلى تصميم الذاكرة. نموذج 3B الذي تكون حالته التكرارية موترًا ثابتًا يتصرف بشكل مختلف تحت المطالبات الطويلة مقارنةً بمحوّل 3B مزوّد بذاكرة KV مكمّمة: الذاكرة ثابتة، لكن للنموذج ميزانية ثابتة لما يستطيع تذكّره، وأصبحت طريقة نسيانه برشاقة هي المواصفة الآن. تتمثل مساهمة Gated DeltaNet-2 بأكملها في قاعدة نسيان أفضل. وهذا يجعله تصميمًا يستحق المتابعة بمعاييره الخاصة حتى لو لم يظهر GDN-2-3B أبدًا تحت ذلك الاسم.

كيف يمكنك فعليًا اختبار شيء كهذا

عندما تصل بنية غير مُثبتة إلى بيئة تشغيل الخدمة، فإن العائق أمام معظم الفرق ليس جدول المعايير — بل إن تبنّيها يعني تكاملًا جديدًا، وعقدًا جديدًا، ونمط فشل جديدًا، وكل ذلك في مواجهة نموذج بلا تاريخ إنتاجي. هذه مشكلة توجيه قبل أن تكون مشكلة نموذج. المجمِّع الذي يضع نقطة نهاية جديدة خلف المفتاح نفسه الذي تستخدمه بالفعل يعني أنك تستطيع أن ترسل شريحة من حركة المرور الحقيقية إليه، وتُبقي نموذجك الحالي كخيار احتياطي، وتدع التحويل التلقائي عند الفشل يلتقط الأخطاء بينما لا يزال المسار الجديد غير مستقر — واجهة API واحدة عبر أكثر من 200 نموذج عند سعر قائمة المزوّد مع هامش ربح 0%، بحيث يكون السعر الذي عُرض عليك هو السعر الذي تدفعه، ويظهر أي تخفيض من المزوّد في اليوم نفسه، لا عند الفاتورة التالية. إن GDN-2-3B نفسه غير مستضاف في أي مكان، لا من قِبلنا ولا من قِبل أي جهة أخرى؛ وهذا ما تعنيه كلمة «غير مُصدَر». المغزى هو النمط الذي ستستخدمه في اليوم الذي يُصدَر فيه.

إذا كنت تريد أن ترى أي النماذج الهجينة وذات السياق الطويل قابلة للتوجيه اليوم، فإن دليل النماذج الحيّ هو القائمة الصادقة — إنه يحدد ما هو قابل للتقديم فعلياً بدلاً من ما تم الإعلان عنه.

Screenshot of the OrcaRouter model catalogue at orcarouter.ai/models, headline '204 models - 16 providers - one API key, one bill', with the filter rail for input modalities, context length, input price, status and series, the Models / Leaderboard / Offers / playground tabs, and a 'How to call any model' panel.

ما الذي ينبغي مراقبته، وما الذي قد يدحض هذا

يتكشف التسريب بإحدى ثلاث طرق، ولكل منها إشارة كاشفة:

• ملف إعدادات — سيكون أقوى تأكيد منفرد هو تهيئة على نمط Nemotron-H تسرد أنواع طبقات GDN-2 في نمط تجاوز هجين. وإلى أن يوجد ملف config.json كهذا، فكل شيء استنتاج من جملة.

• دعم المحرك لنقطة تحقق محددة — نوى GDN-2 موجودة بالفعل؛ ما لا وجود له هو أي محرك يدّعي تقديم هجين GDN-2 مسمّى. إغلاق هذه الفجوة هو الإشارة الحقيقية.

• تغيير في الترخيص — هذا أمر يسهل تفويته. صدرت الشيفرة المرجعية لـ Gated DeltaNet-2 بموجب رخصة NVIDIA Source Code License-NC، وهي غير تجارية، بينما تُطرح أوزان نموذج Nemotron بموجب رخصة NVIDIA Nemotron Open Model License، وهي ليست غير تجارية. وأي نموذج هجين يجمع بين الاثنين سيتعين عليه حل هذا التناقض، وطريقة حله تخبرك ما إذا كانت النتيجة عملاً بحثيًا أم شيئًا يمكنك نشره.

هناك أمران سيبطلان هذا التأطير هنا. إذا اتضح أن «3B» في الاسم تعني شيئًا آخر غير إجمالي المعاملات — معاملات نشطة، أو عدد الطبقات، أو مجرد اسم رمزي — فإن المعادلة الاقتصادية تتغير بالكامل. وإذا اتضح أن عبارة «latent MoE» تصف كتلة MoE عادية، فهذه فكرة أصغر بكثير مما تبدو: إعادة قصّ لـ Nano بطبقة خطية مختلفة، لا شكل جديد.

أسئلة يثيرها هذا

كيف يختلف Gated DeltaNet-2 عن Gated DeltaNet الموجود بالفعل داخل Qwen3.8؟

يستخدم Gated DeltaNet السابق بوابة عددية واحدة لكل من المحو والكتابة؛ أما Gated DeltaNet-2 فيقسّمها إلى بوابتين على مستوى القنوات، ويضيف اضمحلالًا على مستوى القنوات مستعارًا من Kimi Delta Attention. لذا فهو تعميم صارم وليس استبدالًا، ويظهر الفرق العملي في الاسترجاع، لا في الحيرة — فالفجوة في اختبار الإبرة في كومة قش متعددة المفاتيح أوسع بكثير من الفجوة في WikiText.

لماذا قد يستبدل أي شخص Mamba-2 بـ GDN-2 بدلًا من مجرد نشر المزيد من طبقات Mamba-2؟

لأن الورقة تقيس، عند حجم حالة متكررة متطابق، تفوّق Gated DeltaNet-2 في مهام الاسترجاع التي تمارسها أحمال العمل الوكيلة طويلة السياق فعليًا، على حساب عبء ثابت صغير في الإنتاجية. إذا كان حملك كثيف الاسترجاع، فإن هذه المقايضة مواتية؛ وإذا كان محدودًا بالإنتاجية عند سياق قصير، فإن خط أساس Mamba-2 هو الإجابة الأرخص. منصة اختبار 3B طريقة معقولة لمعرفة أيّهما تشبه حركة مرورك.

هل يعني كون المكوّنات مفتوحة المصدر أن النموذج سيكون مفتوحًا أيضًا؟

لا. أوزان Nemotron-3 Nano مفتوحة، والشيفرة المرجعية لـ Gated DeltaNet-2 علنية، لكن لا تُلزم أي من الحقيقتين أحدًا بنشر نقطة حفظ مبنية عليهما — كما أن الترخيص غير التجاري لشيفرة GDN-2 يعني أن الإصدار التجاري سيحتاج إلى ترتيب مختلف. تتراوح النتائج المحتملة بين إصدار بحثي من NVIDIA بموجب Nemotron Open Model License وبين شيء لا يغادر أبدًا عنقودًا داخليًا.

هل هناك أي شيء يمكن تجربته اليوم؟

نعم، لكن ليس GDN-2-3B. نقاط التحقق الخاصة بورقة Gated DeltaNet-2 قابلة لإعادة الإنتاج من مستودع NVlabs بحجم 1.3B على FineWeb-Edu، وNemotron-3 Nano 30B-A3B و4B يعملان على vLLM وSGLang وTensorRT-LLM وllama.cpp اليوم. اختبار أي من النصفين يخبرك بما سيفعله النصف الآخر على الأرجح — وهو أكثر مما تقدمه التغريدة.

لا شيء من هذا يجعل GDN-2-3B حقيقياً. بل يجعله قابلاً للتكذيب، وهو أقصى ما يمكن أن تقدمه جملة واحدة: ملف إعدادات واحد، أو ادعاء محرك واحد، أو مستودع واحد، هو كل ما يفصله عن أن يكون إما إصداراً حقيقياً قريب الأجل، وإما إعادة تركيب تبدو معقولة ولا تُبنى أبداً.