כרטיס כותרת ראשי עם הכותרת 'GDN-2-3B' וכתובית המשנה 'Nemotron-3 Nano היברידי עם Mamba-2 שהוחלף ב-Gated DeltaNet-2 – ציוץ אחד, בלי משקולות', שלושה תגי סטטוס שעליהם כתוב 'לא שוחרר', 'מקור בודד' ו'ללא מדדי ביצועים', ושורת כותרת תחתונה 'מועמד לשחרור שאינו מאומת, ששמו הוזכר בפוסט בודד ב-X בתאריך 2026-09-26.' לוגו OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

הדלפה של GDN-2-3B: היברידי Nemotron-3 Nano עם Gated DeltaNet-2 במקום Mamba-2

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

משפט בודד שפורסם ב-X ב-26 בספטמבר 2026 הוא כל התיעוד הציבורי של GDN-2-3B עד כה. החשבון @teortaxesTex כתב ש"מועמד אחד לשחרור בטווח הקרוב הוא ה-MoE הלטנטי ההיברידי GDN-2-3B, שעוקב אחר הארכיטקטורה של Nemotron-3 Nano אך מחליף את שכבות Mamba-2 ב-GDN-2." זה הכול — אין מאגר Hugging Face, אין קובץ קונפיגורציה, אין טבלת פרמטרים, אין בונה בשם, אין תאריך. GDN-2-3B לא שוחרר, ואין לקרוא את מה שלהלן כאילו שוחרר. מה שהופך את השורה בכל זאת לראויה לפרוק הוא ששני חצאיה מציינים משהו אמיתי וניתן לבדיקה: Gated DeltaNet-2 היא ארכיטקטורת קשב לינארי שפורסמה על ידי NVIDIA, עם מימוש PyTorch ציבורי ונתיב המרה עמוס בכלי TPU, Triton ו-ONNX, ו-Nemotron-3 Nano הוא ההיבריד Mamba-2 במשקולות פתוחות ששוחרר על ידי NVIDIA, שאליו משתילים את הדגם המשוער. זהו מאמר של "מה שאנחנו יודעים עד כה": הארכיטקטורה מתועדת, הדגם הוא שמועה, וההבדל בין שני הדברים האלה הוא כל הסיפור.

הגרסה הקצרה: Gated DeltaNet-2 משנה את האופן שבו מודל קשב ליניארי עורך את הזיכרון הדחוס שלו, והרווחים הנמדדים שלו נוחתים בעוצמה הרבה ביותר בדיוק על עבודת אחזור של הקשר ארוך שמערכת היברידית קטנה נקנית עבורה. Nemotron-3 Nano הוא הדרג הנמוך ביותר במשפחת ההיברידיות הנוכחית של NVIDIA והאחד שסביר ביותר שייחתך מחדש עם רקורנציה זולה יותר. חברו את אלה יחד וקיבלתם מועמד לשחרור סביר — ובדיוק אדם אחד שאומר זאת.

מה שהציוץ אומר ומה שהוא אינו אומר

קראו את המשפט היטב, כי הוא צפוף במיוחד ודק במיוחד בו-זמנית. הוא אומר שהמועמד הוא היברידי (כלומר, יותר מסוג שכבה אחד), 3B (מספר פרמטרים קטן מספיק כדי לפעול על GPU צרכני אחד), ו-MoE לטנטי (עיצוב ניתוב מומחים של NVIDIA שבו טוקנים מוקרנים לממד לטנטי קטן יותר לפני שהם מגיעים למומחים, וזה מה שדרגות Super 120B ו-Ultra 550B משתמשות בו ומה שדרגת Nano שסופקה אינה עושה). הוא אומר שתבנית השכבות עוקבת אחר Nemotron-3 Nano. והוא אומר ששכבות Mamba-2 מוחלפות ב-GDN-2.

מה שזה לא אומר: מי בונה את זה. ל"מועמד לשחרור אחד בטווח הקרוב" אין נושא. מפתה לקרוא לתוך זה את NVIDIA — GDN-2 הוא מחקר של NVIDIA ו-Nemotron-3 Nano הוא מודל של NVIDIA, כך שהשילוב נראה כמו ניסוי מבית — אבל הציוץ לא אומר זאת, וצד שלישי יכול לשלב את השניים באופן חוקי כבר היום, מפני שמשקולות Nemotron-3 Nano פתוחות וקוד הייחוס של Gated DeltaNet-2 פומבי. התייחסו לבונה כבלתי ידוע.

גם לא נאמר מתי. "טווח קרוב" הוא אות התזמון היחיד, והוא אינו תאריך. אין צ'קפוינט להורדה, אין מנוע הסקה שמצהיר שהוא משרת אותו, ואין בנצ'מרק של המודל עצמו בשום מקום. כל נתון במאמר זה שייך ל-Gated DeltaNet-2 או ל-Nemotron-3 Nano כפי שפורסמו בנפרד. אף אחד מהם אינו שייך ל-GDN-2-3B.

שני החצאים של השם, ולמה הם מתאימים

Gated DeltaNet-2 תוך דקה

קשב ליניארי מחליף את מטמון ה-KV הבלתי מוגבל של קשב softmax במצב רקורסיבי בגודל קבוע. החלק הקשה אינו להחליט מה לשכוח — אלא לערוך את המצב הזה בלי לשבש אסוציאציות שכבר מאוחסנות בו. מודלים מבוססי כלל דלתא מחסירים את הקריאה הנוכחית לפני כתיבת ערך חדש; Kimi Delta Attention חידד את השכחה באמצעות דעיכה לפי ערוצים. אולם שניהם עדיין גוזרים שתי החלטות שונות משער סקלרי אחד: כמה תוכן ישן למחוק בצד המפתח, וכמה תוכן חדש לכתוב בצד הערך.

Gated DeltaNet-2, שפורסם על ידי חוקרי NVIDIA Ali Hatamizadeh, Yejin Choi ו-Jan Kautz (arXiv 2605.22791, קוד ייחוס במאגר NVlabs), מפצל את הסקלר הזה לשני שערים לפי ערוץ — שער מחיקה מעל קואורדינטות בצד המפתח ושער כתיבה מעל קואורדינטות בצד הערך — ושומר על הדעיכה לפי ערוץ. המסגור של המאמר הוא שהעיצוב מכליל באופן קפדני את מה שקדם לו: כיווץ שני השערים לאותו סקלר מחזיר את Kimi Delta Attention; כיווץ גם את הדעיכה מחזיר את Gated DeltaNet המוקדם יותר. באבלציה, NVIDIA מדווחת ששער המחיקה אחראי לרוב השיפור, מה שמתאים לתפקידו בהגנה על אסוציאציות בצד המפתח מפני דריסה.

הראיות הן מחקר עם פרמטרים מותאמים, לא מוצר: כל מודל אומן עם 1.3B פרמטרים על 100B טוקנים של FineWeb-Edu, כאשר גודל המצב הרקורנטי נשמר שווה בין Mamba-2, Gated DeltaNet, KDA ו-Mamba-3. בהגדרה הרקורנטית, Gated DeltaNet-2 מציג את פרפלקסיית ה-WikiText הטובה ביותר בקבוצה עם 15.90 לעומת 16.79 של Mamba-2, ואת הדיוק הממוצע הטוב ביותר בשכל ישר עם 53.11 לעומת 52.39 של Mamba-3. בהגדרה ההיברידית — זו שבאמת דומה לתבנית המשולבת של Nemotron-3 Nano — זה 15.62 פרפלקסיית WikiText ו-53.97 דיוק ממוצע, לפני Mamba-3 (15.81 / 52.72) והרבה לפני בסיס Transformer רגיל (19.22 / 50.86).

המקום שבו מתרכז היתרון הוא החלק החשוב עבור מודל קטן עם הקשר ארוך. במבחן המחט בערימת השחת הרב-מפתחי החוזר של RULER באורך 4K, Gated DeltaNet-2 משיג 37.8 לעומת 27.8 עבור Gated DeltaNet הישן יותר ו-28.0 עבור KDA; במבחן מחט בודדת באורך 2K הוא משיג 89.8 לעומת 54.2. בממוצע על פני שישה מערכי אחזור אמיתיים (SWDE, SQuAD, FDA, TriviaQA, NQ, DROP) הוא מוביל את חזית המודלים החוזרים עם 29.88 לעומת 26.84 של Mamba-2, ואת חזית המודלים ההיברידיים עם 42.28 לעומת 40.14 של KDA. NVIDIA גם מדווחת על קפיצת תפוקה כמעט שטוחה עם אורך הרצף על H100 בודד, עם תקורה קבועה קטנה בלבד לעומת KDA עבור השערים הנוספים. אלה נתוני ספק מתוך הטבלאות של המאמר עצמו, אשר לא שוחזרו על ידינו.

Two-column comparison scoreboard titled 'Mamba-2 vs Gated DeltaNet-2 - the scoreboard'. Left column 'Mamba-2': Decay scalar; Erase gate none; Write gate scalar; WikiText ppl 16.79; LMB ppl 12.38; Retrieval avg 26.84. Right column 'Gated DeltaNet-2': Decay channel-wise; Erase gate channel-wise b; Write gate channel-wise w; WikiText ppl 15.90; LMB ppl 11.41; Retrieval avg 29.88. Footer: both recurrent-only, 1.3B params, 100B FineWeb-Edu tokens, figures per NVIDIA's Gated DeltaNet-2 paper, not independently reproduced. OrcaRouter logo bottom-right.

תוכנית Nemotron-3 Nano

Nemotron-3 Nano הוא היברידי Mixture-of-Experts מסוג Mamba-Transformer, והארכיטקטורה היא זו שמושאלת ולא המודל. מהדורת 30B-A3B כוללת 52 שכבות: 23 שכבות Mamba-2, 23 שכבות MoE, ושש שכבות תשומת לב grouped-query, עם 128 מומחים מנותבים ועוד מומחה משותף אחד לכל בלוק MoE, ושישה מומחים פעילים לכל טוקן. הוא נושא 3.5B פרמטרים פעילים לעומת 30B בסך הכול, עבר אימון מקדים על 25 טריליון טוקנים, ותומך בחלונות הקשר של עד 1M טוקנים; הדוח הטכני של NVIDIA עצמה טוען לתפוקת הסקה גבוהה עד פי 3.3 לעומת מודלים פתוחים בגודל דומה כגון GPT-OSS-20B ו-Qwen3-30B-A3B-Thinking-2507. הוא משוחרר תחת רישיון NVIDIA Nemotron Open Model License ומאושר במפורש לשימוש מסחרי.

יש אח קטן יותר שכדאי להכיר, כי "3B" בשם המשוער מתמקם קרוב אליו: Nemotron-3 Nano 4B, שנדחס מ-NVIDIA-Nemotron-Nano-9B-v2 באמצעות מסגרת ה-Elastic של NVIDIA, הוא "בעיקרו שכבות Mamba-2 ו-MLP, בשילוב עם רק ארבע שכבות Attention." אז דרג ה-Nano הוא כבר החלק במשפחה שנסחט ונחתך מחדש. זו הסיבה הסבירה ביותר לכך שגרסה ניסיונית של 3B תתקיים בכלל.

שני אי-התאמות ראויים לציון ולא להחלקה עליהם. ראשית, במשפחה ששוחררה דווקא הדרגות הגדולות — Nemotron-3 Super 120B-A12B ו-Nemotron-3 Ultra 550B-A55B — הן שמשתמשות ב-MoE לטנטי; דרגת ה-Nano לא. לפיכך "MoE לטנטי בצורת Nano" אינו העברה ישירה של תצורת NVIDIA קיימת, אלא שילוב מחדש של רעיונות משתי דרגות, וזה בדיוק מהסוג שמופיע בצ'קפוינטים מחקריים לפני שהוא מופיע במוצר. שנית, בלוקי ה-MoE של משפחת Nano מנותבים עם מומחים צפופים; מעבר לניתוב לטנטי משנה את פרופיל ה-FLOP של כל שכבת מומחים, כך שתווית של 3B תספר לך מעט מאוד על העלות בפועל של הגשת המודל עד שיופיע קובץ תצורה.

מסלול ההסבה אמיתי — המודל אינו.

מה שניתן לאמת הוא ש-Gated DeltaNet-2 מותאם במהירות לסביבות הרצה בייצור. ב-23 בספטמבר 2026, Pull Request למאגר Tokamax של OpenXLA הוסיף קרנל ואופרטור Pallas של Gated Delta Net 2 עבור TPU, כולל מעבר אחורי של autograd על פני שישה קלטים ומספרי benchmark ב-Cloud TPU v7x. Flash Linear Attention נושאת קרנלי prefill ממוזגים של GDN-2 מאז סוף יוני — ה-Pull Request שם מדווח על האצת prefill ממוצעת של פי 2.48 ומקרה מיטבי של פי 5.13 ב-H100 — עם עדכוני המשך בספטמבר שתיקנו באג בסדר השערים ומייעלים את מסלול אימון ה-chunk. ל-ONNX יש פער מפרט פתוח שהוגש נגדו, מפני שאופרטור LinearAttention של opset 27 אינו יכול לבטא את שער המחיקה הערוצי של GDN-2. ו-Megatron-Bridge של NVIDIA עצמה הוסיפה ספירת FLOPs הן עבור שכבות GDN היברידיות והן עבור דחיסת latent-MoE במרץ.

שום דבר מזה אינו שחרור מודל, וזו תהיה טעות לקרוא לזה כך. עבודת קרנל היא תשתית; היא אומרת שארכיטקטורה נלקחת ברצינות, לא שקיים צ'קפוינט. מה שכן היא נותנת לך הוא דבר מוחשי לנטר: אם היברידי GDN-2 אכן יגיע לעולם, הוא יגיע תחילה כתמיכה שנוחתת במנוע הגשה, ורק אחר כך כהכרזה, ותמיכת המנוע כבר קיימת בחלקה. העבודה על Tokamax ו-Flash Linear Attention היא גם הטיעון החזק ביותר לכך שהשילוב בציוץ הוא קוהרנטי מבחינה טכנית ולא מומצא — החלקים הדרושים כדי לשרת היברידי GDN-2 נבנים בידי אנשים שאינם האדם שכתב את הציוץ.

Screenshot of the NVlabs/GatedDeltaNet-2 GitHub repository page in English: the title 'Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention', the file list with README.md, LICENSE, SECURITY.md and lit_gpt/scripts directories, and the About panel showing 317 stars, 33 forks and a last commit from last month.

למה היברידי GDN-2 בנפח 3B יהיה משמעותי אם הוא ישוחרר

ההצדקה לשילוב היא כלכלית ולא מונעת־בנצ'מרקים. היברידי בדרגת 3B עם מצב רקורנטי בגודל קבוע הוא מודל שאפשר להריץ על GPU צרכני אחד בלי מטמון KV שגדל עם הפרומפט — וזו אותה עסקה ש-Nemotron-3 Nano 4B כבר מציע. החלפת שכבות Mamba-2 ב-GDN-2 משיגה, לפי המספרים שבמאמר, אחזור רב־מפתחי טוב יותר וממוצעי אחזור בעולם האמיתי טובים יותר בגודל מצב תואם — שני התחומים שבהם משפחת כלל הדלתא הישנה יותר הייתה החלשה ביותר. זה שדרוג ממוקד, לא דורי, וזה מסוג השינויים ששווים 3B פרמטרים.

זו גם תזכורת לכך שהתחרות המעניינת במודלים קטנים עברה מספירת פרמטרים לעיצוב זיכרון. מודל 3B שהמצב הרקורנטי שלו הוא טנזור קבוע מתנהג אחרת תחת פרומפטים ארוכים מאשר טרנספורמר 3B עם מטמון KV מכומת: הזיכרון שטוח, אבל למודל יש תקציב קבוע למה שהוא יכול לזכור, וכמה בחן הוא שוכח הוא כעת המפרט. כל התרומה של Gated DeltaNet-2 היא כלל שכחה טוב יותר. זה הופך אותו לעיצוב ששווה לעקוב אחריו בזכות עצמו, גם אם GDN-2-3B לעולם לא יופיע בשם הזה.

איך בעצם היית בודק משהו כזה

כאשר ארכיטקטורה לא מוכחת מגיעה לסביבת הרצה שמגישה שירות, החסם עבור רוב הצוותים אינו טבלת ההשוואות — אלא שאימוץ שלה פירושו אינטגרציה חדשה, חוזה חדש ומצב כשל חדש, והכול מול מודל בלי היסטוריית ייצור. זו בעיית ניתוב לפני שזו בעיית מודל. אגרגטור שמציב נקודת קצה חדשה מאחורי אותו מפתח שאתם כבר משתמשים בו מאפשר לכם לשלוח אליו פלח מתעבורה אמיתית, להשאיר את המודל הקיים שלכם כגיבוי, ולתת למעבר אוטומטי לגיבוי לתפוס את השגיאות בזמן שהנתיב החדש עדיין לא יציב — API אחד על פני 200+ מודלים במחיר מחירון של הספק עם 0% תוספת, כך שהתמחור שנמסר לכם הוא התמחור שאתם משלמים, והנחה מצד הספק מופיעה באותו יום ולא בחשבונית הבאה. GDN-2-3B עצמו אינו מתארח בשום מקום, לא אצלנו ולא אצל אף אחד אחר; זה מה ש"לא שוחרר" אומר. הנקודה היא התבנית שבה תשתמשו ביום שבו זה יקרה.

אם אתה רוצה לראות אילו מודלים היברידיים ובעלי הקשר ארוך ניתנים לניתוב היום, קטלוג המודלים החי הוא הרשימה הכנה — הוא מסמן מה שאפשר להעמיד לשירות בפועל ולא מה שהוכרז.

Screenshot of the OrcaRouter model catalogue at orcarouter.ai/models, headline '204 models - 16 providers - one API key, one bill', with the filter rail for input modalities, context length, input price, status and series, the Models / Leaderboard / Offers / playground tabs, and a 'How to call any model' panel.

על מה לשים לב, ומה יפריך את זה

ההדלפה נפתרת באחת משלוש דרכים, ולכל אחת יש סימן מזהה:

• קובץ הגדרות — האישוש החזק ביותר היחיד יהיה תצורה בסגנון Nemotron-H שמפרטת סוגי שכבות GDN-2 בתבנית דריסה היברידית. עד שקיים קובץ config.json כזה, הכול הוא הסקה ממשפט.

• תמיכת מנוע בצ'קפוינט ספציפי — קרנלים של GDN-2 כבר קיימים; מה שלא קיים הוא שום מנוע שמצהיר שהוא מגיש היברידי GDN-2 בעל שם. סגירת הפער הזה היא האות האמיתי.

• שינוי רישיון — את זה קל להחמיץ. קוד הייחוס של Gated DeltaNet-2 משוחרר תחת NVIDIA Source Code License-NC, שהוא לא-מסחרי, בעוד שמשקולות מודל Nemotron מגיעות תחת NVIDIA Nemotron Open Model License, שאינו כזה. היברידי שמשלב את השניים יצטרך לפתור את המתח הזה, ואופן הפתרון שלו אומר לך אם התוצאה היא תוצר מחקרי או משהו שאפשר לפרוס.

שני דברים היו מפריכים את המסגור כאן. אם ה־"3B" שבשם יתברר שמשמעותו משהו אחר מאשר סך הפרמטרים — פרמטרים פעילים, או מספר שכבות, או פשוט שם קוד — הכלכלה משתנה לחלוטין. ואם הביטוי "latent MoE" יתברר כמתאר בלוק MoE רגיל, אז זה רעיון קטן בהרבה מכפי שהוא נראה: חיתוך מחדש של Nano עם שכבת לינארית שונה, לא צורה חדשה.

שאלות שהדבר הזה מעלה

במה שונה Gated DeltaNet-2 מ-Gated DeltaNet שכבר נמצא בתוך Qwen3.8?

ה-Gated DeltaNet המוקדם משתמש בשער סקלרי יחיד גם למחיקה וגם לכתיבה; Gated DeltaNet-2 מפצל אותו לשני שערים ערוציים ומוסיף דעיכה ערוצית השאולה מ-Kimi Delta Attention. לכן זו הכללה מוחלטת ולא החלפה, וההבדל המעשי בא לידי ביטוי באחזור, לא בפרפלקסיה — הפער במשימת needle-in-a-haystack עם ריבוי מפתחות רחב בהרבה מהפער ב-WikiText.

מדוע שמישהו יחליף את Mamba-2 ב-GDN-2 במקום פשוט לשחרר עוד שכבות של Mamba-2?

מכיוון שבגודל מצב רקורנטי תואם, המאמר מודד את Gated DeltaNet-2 כמובילה במשימות האחזור שעומסי עבודה סוכניים ארוכי הקשר באמת מפעילים, במחיר של תקורה קבועה קטנה בתפוקה. אם עומס העבודה שלך עתיר אחזור, הפשרה הזו משתלמת; אם הוא מוגבל בתפוקה בהקשר קצר, בסיס Mamba-2 הוא הפתרון הזול יותר. סביבת בדיקה של 3B היא דרך סבירה לגלות לאיזה מהשניים נראית התעבורה שלך.

האם היותם של החלקים בקוד פתוח אומר שגם המודל יהיה פתוח?

לא. המשקלות של Nemotron-3 Nano פתוחים וקוד הייחוס של Gated DeltaNet-2 ציבורי, אבל אף אחת מהעובדות האלה לא מחייבת מישהו לפרסם צ'קפוינט שנבנה מהם — והרישיון הלא-מסחרי על הקוד של GDN-2 אומר שפרסום מסחרי ידרוש הסדר אחר. התוצאות הסבירות נעות בין פרסום מחקר של NVIDIA תחת רישיון Nemotron Open Model License לבין משהו שלעולם לא יוצא מאשכול פנימי.

יש משהו לנסות היום?

כן, אבל לא GDN-2-3B. הצ'קפוינטים של המאמר Gated DeltaNet-2 ניתנים לשחזור ממאגר NVlabs בגודל 1.3B על FineWeb-Edu, ו-Nemotron-3 Nano 30B-A3B ו-4B רצים על vLLM, SGLang, TensorRT-LLM ו-llama.cpp היום. בדיקת כל חצי מספרת לך מה החצי השני כנראה יעשה — וזה יותר ממה שהציוץ נותן לך.

שום דבר מזה לא הופך את GDN-2-3B לאמיתי. זה הופך אותו לניתן להפרכה, וזה המרב שמשפט בודד יכול להציע: במרחק של קובץ תצורה אחד, הצהרת מנוע אחת או מאגר אחד מלהפוך או לגרסה אמיתית בטווח הקרוב או לשילוב מחדש שנשמע סביר שלעולם לא נבנה.