
GDN-2-3B หลุด: Nemotron-3 Nano ชนิดไฮบริดที่ใช้ Gated DeltaNet-2 แทน Mamba-2
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 477 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 187 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
ประโยคเดียวที่โพสต์บน X เมื่อวันที่ 26 กันยายน 2026 คือบันทึกสาธารณะทั้งหมดของ GDN-2-3B เท่าที่มีจนถึงตอนนี้ บัญชี @teortaxesTex เขียนว่า "หนึ่งในตัวเลือกที่จะเปิดตัวในระยะใกล้นี้คือ GDN-2-3B แบบไฮบริด latent MoE ซึ่งทำตามสถาปัตยกรรม Nemotron-3 Nano แต่แทนที่เลเยอร์ Mamba-2 ด้วย GDN-2" มีแค่นั้น — ไม่มีที่เก็บบน Hugging Face ไม่มีไฟล์คอนฟิก ไม่มีตารางพารามิเตอร์ ไม่มีชื่อผู้สร้าง ไม่มีวันที่ GDN-2-3B ยังไม่ได้รับการเปิดตัว และไม่ควรอ่านสิ่งใดด้านล่างราวกับว่ามันถูกเปิดตัวแล้ว สิ่งที่ทำให้ประโยคนี้ยังน่าขบคิดแกะความอยู่ก็คือ ทั้งสองครึ่งของมันต่างอ้างถึงสิ่งที่มีอยู่จริงและตรวจสอบได้: Gated DeltaNet-2 เป็นสถาปัตยกรรม linear attention ที่ NVIDIA เผยแพร่ พร้อมการใช้งานบน PyTorch ที่เปิดเผยต่อสาธารณะ และมีร่องรอยการพอร์ตที่คึกคักผ่านเครื่องมือ TPU, Triton และ ONNX และ Nemotron-3 Nano คือโมเดลไฮบริด Mamba-2 แบบเปิดน้ำหนักที่ NVIDIA วางจำหน่ายแล้ว ซึ่งโมเดลที่ลือกันอยู่นี้กำลังถูกต่อกิ่งเข้ากับมัน นี่คือบทความแบบ "เท่าที่เรารู้จนถึงตอนนี้": สถาปัตยกรรมนั้นมีเอกสารบันทึกไว้ โมเดลนั้นเป็นเพียงข่าวลือ และความต่างระหว่างสองสิ่งนั้นคือเรื่องราวทั้งหมด
ฉบับสั้น: Gated DeltaNet-2 เปลี่ยนวิธีที่โมเดลแบบ linear attention แก้ไขหน่วยความจำที่บีบอัดไว้ของตัวเอง และผลตอบแทนที่วัดได้ก็ตกหนักที่สุดพอดีกับงานดึงข้อมูลบริบทยาว ซึ่งเป็นเหตุผลที่ซื้อไฮบริดขนาดเล็กมา Nemotron-3 Nano เป็นระดับเล็กที่สุดในตระกูลไฮบริดรุ่นปัจจุบันของ NVIDIA และเป็นตัวที่มีแนวโน้มมากที่สุดที่จะถูกตัดใหม่ด้วย recurrence ที่ถูกกว่า เมื่อนำสองเรื่องนี้มารวมกัน ก็ได้ผู้สมัครวางจำหน่ายที่เป็นไปได้ — และมีเพียงคนเดียวที่พูดแบบนั้น
สิ่งที่ทวีตกล่าวถึงและไม่กล่าวถึง
อ่านประโยคนี้ให้ดี เพราะมันทั้งแน่นและบางผิดปกติในเวลาเดียวกัน ประโยคนี้บอกว่าแคนดิเดตนี้เป็นแบบผสม (คือมีเลเยอร์มากกว่าหนึ่งประเภท) 3B (จำนวนพารามิเตอร์ที่เล็กพอจะรันบน GPU สำหรับผู้ใช้ทั่วไปหนึ่งตัว) และเป็นMoE แบบ latent (การออกแบบการจัดเส้นทางผู้เชี่ยวชาญของ NVIDIA ซึ่งโทเคนจะถูกฉายเข้าสู่มิติ latent ที่เล็กกว่าก่อนที่จะไปถึงผู้เชี่ยวชาญ ซึ่งเป็นสิ่งที่ระดับ Super 120B และ Ultra 550B ใช้ และเป็นสิ่งที่ระดับ Nano ที่จัดส่งแล้วไม่ได้ใช้) ประโยคนี้บอกว่ารูปแบบเลเยอร์เป็นไปตาม Nemotron-3 Nano และบอกว่าเลเยอร์ Mamba-2 ถูกแทนที่ด้วย GDN-2
สิ่งที่มันไม่ได้บอกคือ ใครเป็นคนสร้างมันขึ้นมา "หนึ่งรีลีสแคนดิเดตระยะใกล้นี้" ไม่มีประธาน มันชวนให้ตีความว่า NVIDIA อยู่เบื้องหลัง — GDN-2 เป็นงานวิจัยของ NVIDIA และ Nemotron-3 Nano เป็นโมเดลของ NVIDIA ดังนั้นการจับคู่กันนี้จึงดูเหมือนการทดลองภายในองค์กร — แต่ทวีตไม่ได้บอกเช่นนั้น และบุคคลที่สามก็สามารถนำทั้งสองมารวมกันได้อย่างถูกกฎหมายในวันนี้ เนื่องจากน้ำหนักโมเดลของ Nemotron-3 Nano เปิดให้ใช้ได้ และโค้ดอ้างอิงของ Gated DeltaNet-2 ก็เป็นสาธารณะ ให้ถือว่าผู้สร้างยังไม่ทราบแน่ชัด
และก็ไม่ได้บอกด้วยว่าเมื่อไร “Near-term” เป็นสัญญาณเวลาชิ้นเดียวเท่านั้น และมันไม่ใช่วันที่ ไม่มีเช็กพอยต์ให้ดาวน์โหลด ไม่มีเอนจินอินเฟอเรนซ์ใดที่อ้างว่าให้บริการมัน และไม่มีเบนช์มาร์กของโมเดลนี้เองที่ไหนเลย ตัวเลขทุกตัวในบทความนี้เป็นของ Gated DeltaNet-2 หรือของ Nemotron-3 Nano ตามที่เผยแพร่แยกกัน ไม่มีสักตัวที่เป็นของ GDN-2-3B
สองครึ่งของชื่อ และเหตุผลที่มันลงตัว
Gated DeltaNet-2 ในหนึ่งนาที
แอตเทนชันเชิงเส้นแทนที่แคช KV แบบไม่จำกัดขนาดของแอตเทนชันซอฟต์แมกซ์ด้วยสถานะรีเคอร์เรนต์ขนาดคงที่ สิ่งที่ยากไม่ใช่การตัดสินใจว่าจะลืมอะไร แต่คือการแก้ไขสถานะนั้นโดยไม่ทำให้ความสัมพันธ์ที่จัดเก็บไว้แล้วเสียหาย โมเดลแบบ Delta-rule จะลบค่าที่อ่านได้ปัจจุบันก่อนเขียนค่าใหม่ Kimi Delta Attention ทำให้การลืมคมชัดยิ่งขึ้นด้วยการสลายตัวแบบรายช่องสัญญาณ อย่างไรก็ตาม ทั้งสองยังคงใช้เกตสเกลาร์เพียงตัวเดียวขับเคลื่อนการตัดสินใจที่แตกต่างกันสองอย่าง ได้แก่ จะลบเนื้อหาเก่ามากน้อยเพียงใดทางฝั่งคีย์ และจะคอมมิตเนื้อหาใหม่มากน้อยเพียงใดทางฝั่งแวลู
Gated DeltaNet-2 ซึ่งเผยแพร่โดยนักวิจัย NVIDIA อย่าง Ali Hatamizadeh, Yejin Choi และ Jan Kautz (arXiv 2605.22791, โค้ดอ้างอิงในรีโพซิทอรี NVlabs) แยกสเกลาร์ดังกล่าวออกเป็นเกตแบบรายช่องสัญญาณสองตัว — เกตลบ (erase gate) เหนือพิกัดฝั่งคีย์ และเกตเขียน (write gate) เหนือพิกัดฝั่งค่า — และคงการสลายตัวแบบรายช่องสัญญาณไว้ กรอบของบทความคือการออกแบบนี้เป็นการวางนัยทั่วไปอย่างเคร่งครัดต่อสิ่งที่มาก่อนหน้า: ยุบเกตทั้งสองให้เป็นสเกลาร์เดียวกัน แล้วจะได้ Kimi Delta Attention กลับคืนมา; ยุบการสลายตัวด้วยเช่นกัน ก็จะได้ Gated DeltaNet รุ่นก่อนหน้ากลับคืนมา ในการทดลองแบบ ablation NVIDIA รายงานว่า erase gate คิดเป็นส่วนใหญ่ของผลลัพธ์ที่ดีขึ้น ซึ่งสอดคล้องกับบทบาทของมันในการปกป้องความเชื่อมโยงฝั่งคีย์จากการถูกเขียนทับ
หลักฐานนี้คือการศึกษาแบบจับคู่พารามิเตอร์ ไม่ใช่ผลิตภัณฑ์: ทุกโมเดลถูกฝึกด้วยพารามิเตอร์ 1.3B บนโทเคน FineWeb-Edu จำนวน 100B โดยมีขนาดสถานะแบบเกิดซ้ำเท่ากันใน Mamba-2, Gated DeltaNet, KDA และ Mamba-3 ในรูปแบบเกิดซ้ำ Gated DeltaNet-2 ทำค่า perplexity ของ WikiText ได้ดีที่สุดในกลุ่มที่ 15.90 เทียบกับ 16.79 ของ Mamba-2 และทำความแม่นยำเฉลี่ยด้านสามัญสำนึกได้ดีที่สุดที่ 53.11 เทียบกับ 52.39 ของ Mamba-3 ในรูปแบบไฮบริด — แบบที่คล้ายกับรูปแบบสลับของ Nemotron-3 Nano จริง ๆ — ได้ค่า perplexity ของ WikiText 15.62 และความแม่นยำเฉลี่ย 53.97 ซึ่งนำหน้า Mamba-3 (15.81 / 52.72) และนำหน้า baseline Transformer ธรรมดาอย่างมาก (19.22 / 50.86)
จุดที่ข้อได้เปรียบกระจุกตัวอยู่คือส่วนที่สำคัญสำหรับโมเดลบริบทยาวขนาดเล็ก ในแบบทดสอบ needle-in-a-haystack แบบหลายคีย์ของ RULER ที่ 4K Gated DeltaNet-2 ได้คะแนน 37.8 เทียบกับ 27.8 ของ Gated DeltaNet รุ่นเก่า และ 28.0 ของ KDA; ในแบบทดสอบ needle เดียวที่ 2K ได้คะแนน 89.8 เทียบกับ 54.2 เมื่อเฉลี่ยจากชุดข้อมูลการดึงข้อมูลจริงหกชุด (SWDE, SQuAD, FDA, TriviaQA, NQ, DROP) มันนำหน้าแนวหน้าของกลุ่มรีเคอร์เรนต์ที่ 29.88 เทียบกับ 26.84 ของ Mamba-2 และนำหน้าแนวหน้าของกลุ่มไฮบริดที่ 42.28 เทียบกับ 40.14 ของ KDA NVIDIA ยังรายงานว่าอัตราการประมวลผลแทบไม่เปลี่ยนแปลงตามความยาวลำดับบน H100 ตัวเดียว โดยมีโอเวอร์เฮดคงที่เพียงเล็กน้อยเหนือ KDA สำหรับเกตเพิ่มเติม ตัวเลขเหล่านี้เป็นตัวเลขจากผู้ผลิตที่มาจากตารางในบทความเอง ซึ่งเราไม่ได้ทำการทดลองซ้ำ

พิมพ์เขียว Nemotron-3 Nano
Nemotron-3 Nano เป็น Mixture-of-Experts แบบไฮบริด Mamba-Transformer และเป็นสถาปัตยกรรมที่ถูกยืมมาใช้มากกว่าตัวโมเดลเอง รุ่น 30B-A3B ประกอบด้วย 52 เลเยอร์: 23 เลเยอร์ Mamba-2, 23 เลเยอร์ MoE และ 6 เลเยอร์ grouped-query attention โดยมีผู้เชี่ยวชาญแบบ routed 128 ตัว บวกกับผู้เชี่ยวชาญที่แชร์ร่วมกัน 1 ตัวต่อบล็อก MoE และมีผู้เชี่ยวชาญที่ทำงานอยู่ 6 ตัวต่อโทเคน มีพารามิเตอร์ที่ทำงานอยู่ 3.5B เทียบกับ 30B ทั้งหมด ถูกพรีเทรนด้วยโทเคน 25 ล้านล้านโทเคน และรองรับหน้าต่างบริบทสูงสุดถึง 1 ล้านโทเคน รายงานทางเทคนิคของ NVIDIA เองอ้างว่ามีอัตราการประมวลผล inference สูงกว่าถึง 3.3 เท่าเมื่อเทียบกับโมเดลเปิดขนาดใกล้เคียงกัน เช่น GPT-OSS-20B และ Qwen3-30B-A3B-Thinking-2507 เผยแพร่ภายใต้ NVIDIA Nemotron Open Model License และได้รับอนุญาตอย่างชัดเจนสำหรับการใช้งานเชิงพาณิชย์
มีรุ่นน้องที่เล็กกว่าซึ่งน่าทำความรู้จัก เพราะ "3B" ในชื่อที่ถูกลือนั้นอยู่ใกล้เคียงกับมันมาก: Nemotron-3 Nano 4B ซึ่งถูกบีบอัดจาก NVIDIA-Nemotron-Nano-9B-v2 โดยใช้เฟรมเวิร์ก Elastic ของ NVIDIA นั้น "ส่วนใหญ่เป็นเลเยอร์ Mamba-2 และ MLP รวมกับเลเยอร์ Attention เพียงสี่เลเยอร์" ดังนั้นระดับ Nano จึงเป็นส่วนของตระกูลที่ถูกบีบและตัดใหม่แล้วอยู่แล้ว นั่นคือเหตุผลเดียวที่เป็นไปได้มากที่สุดที่ตัวแปรทดลองขนาด 3B จะมีอยู่ได้เลย
ความไม่สอดคล้องสองจุดควรค่าแก่การชี้ให้เห็นมากกว่าจะกลบเกลื่อนให้เรียบร้อย อย่างแรก ในตระกูลที่วางจำหน่ายจริงนั้นเป็นระดับใหญ่ — Nemotron-3 Super 120B-A12B และ Nemotron-3 Ultra 550B-A55B — ที่ใช้ latent MoE; ส่วนระดับ Nano ไม่ได้เป็นเช่นนั้น "Nano-shaped latent MoE" จึงไม่ใช่การพอร์ตตรง ๆ ของคอนฟิก NVIDIA ที่มีอยู่ แต่เป็นการนำแนวคิดของสองระดับมาประกอบกันใหม่ ซึ่งเป็นสิ่งที่มักปรากฏในเช็กพอยต์งานวิจัยก่อนจะปรากฏในผลิตภัณฑ์ ประการที่สอง บล็อก MoE ของตระกูล Nano ใช้การกำหนดเส้นทางแบบ dense-expert; การเปลี่ยนไปใช้ latent routing เปลี่ยนโปรไฟล์ FLOP ของทุกเลเยอร์ expert ดังนั้นป้ายกำกับ 3B จะบอกคุณได้น้อยมากว่าโมเดลมีต้นทุนในการให้บริการจริงเท่าไร จนกว่าไฟล์คอนฟิกจะปรากฏขึ้น
ร่องรอยการพอร์ตเป็นของจริง — แต่โมเดลไม่จริง
สิ่งที่ยืนยันได้คือ Gated DeltaNet-2 กำลังถูกนำไปปรับใช้กับรันไทม์โปรดักชันอย่างรวดเร็ว เมื่อวันที่ 23 กันยายน 2026 พูลรีเควสต์ไปยังรีโพซิทอรี Tokamax ของ OpenXLA ได้เพิ่มเคอร์เนลและโอเปอเรเตอร์ Gated Delta Net 2 Pallas สำหรับ TPU รวมถึง backward pass ของ autograd บนอินพุตหกตัว และตัวเลข benchmark บน Cloud TPU v7x Flash Linear Attention มีเคอร์เนล prefill แบบ fused ของ GDN-2 มาตั้งแต่ปลายเดือนมิถุนายน — พูลรีเควสต์ที่นั่นรายงานความเร็ว prefill เพิ่มขึ้นเฉลี่ย 2.48 เท่า และกรณีดีที่สุด 5.13 เท่าบน H100 — โดยมีการติดตามผลในเดือนกันยายนที่แก้บั๊กการเรียงลำดับเกตและปรับแต่งเส้นทางการฝึกแบบ chunk ONNX มีช่องว่างข้อกำหนดที่ยังเปิดอยู่ซึ่งถูกรายงานไว้ เนื่องจากโอเปอเรเตอร์ LinearAttention ของ opset 27 ไม่สามารถแสดง erase gate แบบรายช่องสัญญาณของ GDN-2 ได้ และ Megatron-Bridge ของ NVIDIA เองได้เพิ่มการคำนวณ FLOPs สำหรับทั้งเลเยอร์ GDN แบบไฮบริดและการบีบอัด latent-MoE ในเดือนมีนาคม
ไม่มีสิ่งใดในนั้นเป็นการเปิดตัวโมเดล และมันจะเป็นการผิดพลาดที่จะตีความว่ามันเป็นเช่นนั้น งานเคอร์เนลเป็นโครงสร้างพื้นฐาน มันบอกว่าสถาปัตยกรรมหนึ่งกำลังได้รับการพิจารณาอย่างจริงจัง ไม่ได้บอกว่ามีเช็กพอยต์อยู่ สิ่งที่มันให้คุณคือสิ่งที่จับต้องได้ให้เฝ้าจับตามอง: ถ้าไฮบริด GDN-2 ออกสู่สาธารณะจริง มันจะมาถึงในรูปแบบของการรองรับที่ลงในเสิร์ฟวิงเอนจินก่อน และเป็นการประกาศในภายหลัง และการรองรับในเอนจินก็มีอยู่บางส่วนแล้ว งานของ Tokamax และ Flash Linear Attention ยังเป็นข้อโต้แย้งที่แข็งแกร่งที่สุดว่าการจับคู่ในทวีตนั้นมีความสอดคล้องทางเทคนิคมากกว่าที่จะเป็นเรื่องกุขึ้นมา — ชิ้นส่วนที่จำเป็นสำหรับการให้บริการไฮบริด GDN-2 กำลังถูกสร้างโดยผู้คนที่ไม่ได้เป็นคนเดียวกับผู้เขียนทวีต

ทำไมไฮบริด GDN-2 ขนาด 3B จะสำคัญ ถ้ามันเปิดตัว
เหตุผลของการรวมกันนี้เป็นเรื่องเศรษฐกิจมากกว่าที่จะขับเคลื่อนด้วยผลเบนช์มาร์ก ไฮบริดระดับ 3B ที่มีสเตตแบบเกิดซ้ำขนาดคงที่ คือโมเดลที่คุณรันบน GPU สำหรับผู้บริโภคเพียงตัวเดียวได้ โดยไม่มี KV cache ที่ขยายตามพรอมป์ต์ของคุณ ซึ่งเป็นข้อตกลงแบบเดียวกับที่ Nemotron-3 Nano 4B ทำอยู่แล้ว การสลับเลเยอร์ Mamba-2 เป็น GDN-2 ให้ผลตอบแทน จากตัวเลขในเปเปอร์ คือการดึงข้อมูลแบบหลายคีย์ที่ดีขึ้น และค่าเฉลี่ยการดึงข้อมูลในโลกจริงที่ดีขึ้นที่ขนาดสเตตเท่ากัน — ซึ่งเป็นสองจุดที่ตระกูล delta-rule แบบเก่าอ่อนแอที่สุด นั่นคือการอัปเกรดแบบเจาะจง ไม่ใช่การอัปเกรดทั้งรุ่น และเป็นความเปลี่ยนแปลงประเภทที่คุ้มค่ากับพารามิเตอร์ 3B
นี่ยังเป็นเครื่องเตือนใจว่าการแข่งขันที่น่าสนใจในโมเดลขนาดเล็กได้ย้ายจากจำนวนพารามิเตอร์ไปสู่การออกแบบหน่วยความจำแล้ว โมเดล 3B ที่สถานะรีเคอร์เรนต์เป็นเทนเซอร์แบบคงที่ให้พฤติกรรมภายใต้พรอมป์ยาวแตกต่างจากทรานส์ฟอร์มเมอร์ 3B ที่มีแคช KV แบบควอนไทซ์: หน่วยความจำคงที่แบนราบ แต่โมเดลมีงบประมาณจำกัดสำหรับสิ่งที่จำได้ และความนุ่มนวลในการลืมกลายเป็นสเปกแล้ว ผลงานทั้งหมดของ Gated DeltaNet-2 คือกฎการลืมที่ดีขึ้น นั่นทำให้มันเป็นการออกแบบที่ควรจับตามองในแบบของมันเอง ถึงแม้ GDN-2-3B จะไม่ปรากฏภายใต้ชื่อนั้นเลยก็ตาม
คุณจะทดสอบอะไรแบบนี้จริง ๆ ได้อย่างไร
เมื่อสถาปัตยกรรมที่ยังไม่ผ่านการพิสูจน์มาถึงรันไทม์สำหรับให้บริการ อุปสรรคของทีมส่วนใหญ่ไม่ใช่ตาราง benchmark — แต่คือการนำมันมาใช้หมายความว่าจะมีการผสานรวมใหม่ สัญญาใหม่ และรูปแบบความล้มเหลวใหม่ ทั้งหมดนี้กับโมเดลที่ไม่มีประวัติการใช้งานจริง นี่คือปัญหาการกำหนดเส้นทางก่อนที่จะเป็นปัญหาของโมเดล แอกกรีเกเตอร์ที่วางเอนด์พอยต์ใหม่ไว้หลังคีย์เดียวกับที่คุณใช้อยู่แล้ว หมายความว่าคุณสามารถส่งทราฟฟิกจริงส่วนหนึ่งไปที่มัน เก็บโมเดลเดิมของคุณไว้เป็นตัวสำรอง และปล่อยให้ การสลับไปยังระบบสำรองอัตโนมัติ ดักจับข้อผิดพลาดในขณะที่เส้นทางใหม่ยังไม่มั่นคง — API เดียวที่ครอบคลุมโมเดล 200+ ตัว ใน ราคาตามรายการของผู้ให้บริการ โดยคิดบวกเพิ่ม 0% ดังนั้นราคาที่คุณได้รับแจ้งคือราคาที่คุณจ่าย และส่วนลดจากผู้ขายจะปรากฏในวันเดียวกัน แทนที่จะไปปรากฏในใบแจ้งหนี้ครั้งถัดไป GDN-2-3B เองไม่ได้ถูกโฮสต์อยู่ที่ใดเลย ไม่ว่าโดยเราหรือโดยใครอื่น; นั่นคือความหมายของคำว่า “ยังไม่เปิดตัว” ประเด็นคือแพตเทิร์นที่คุณจะใช้ในวันที่มันเปิดตัว
หากคุณต้องการดูว่าโมเดลไฮบริดและโมเดลบริบทยาวใดบ้างที่สามารถกำหนดเส้นทางได้ในวันนี้ แคตตาล็อกโมเดลสด คือรายการที่ซื่อสัตย์ — มันระบุสิ่งที่สามารถให้บริการได้จริงแทนที่จะเป็นสิ่งที่ถูกประกาศ

สิ่งที่ต้องจับตามอง และอะไรที่จะหักล้างสิ่งนี้ได้
การรั่วไหลคลี่คลายลงได้ในหนึ่งในสามวิธี และแต่ละวิธีล้วนมีสัญญาณบอก:
• ไฟล์คอนฟิก — หลักฐานยืนยันที่ชัดเจนที่สุดคือการกำหนดค่าสไตล์ Nemotron-H ที่ระบุประเภทเลเยอร์ GDN-2 ในรูปแบบการโอเวอร์ไรด์แบบไฮบริด จนกว่าจะมี config.json แบบนั้นอยู่ ทุกสิ่งทุกอย่างเป็นการอนุมานจากประโยคหนึ่งเท่านั้น
• การรองรับจากเอนจินสำหรับเช็กพอยต์ที่เจาะจง — เคอร์เนล GDN-2 มีอยู่แล้ว สิ่งที่ยังไม่มีคือเอนจินใด ๆ ที่อ้างว่าให้บริการ GDN-2 แบบไฮบริดที่มีชื่อระบุ การปิดช่องว่างนั้นต่างหากคือสัญญาณที่แท้จริง
• การเปลี่ยนสัญญาอนุญาต — ข้อนี้ง่ายที่จะมองข้าม โค้ดอ้างอิงของ Gated DeltaNet-2 เผยแพร่ภายใต้ NVIDIA Source Code License-NC ซึ่งเป็นแบบไม่ใช้เชิงพาณิชย์ ขณะที่น้ำหนักโมเดล Nemotron เผยแพร่ภายใต้ NVIDIA Nemotron Open Model License ซึ่งไม่ใช่แบบนั้น ไฮบริดที่รวมทั้งสองสิ่งเข้าด้วยกันจะต้องคลี่คลายความตึงเครียดนี้ และวิธีที่มันคลี่คลายจะบอกคุณว่าผลลัพธ์ที่ได้เป็นชิ้นงานวิจัยหรือเป็นสิ่งที่คุณนำไปใช้งานจริงได้
มีสองสิ่งที่อาจทำให้กรอบความเข้าใจตรงนี้ผิดไปได้ ถ้า "3B" ในชื่อนั้นกลายเป็นว่าหมายถึงสิ่งอื่นที่ไม่ใช่จำนวนพารามิเตอร์ทั้งหมด — ไม่ว่าจะเป็นพารามิเตอร์ที่ใช้งานจริง หรือจำนวนเลเยอร์ หรือแค่ชื่อรหัสเรียกเล่น ๆ — เศรษฐศาสตร์ของเรื่องนี้ก็เปลี่ยนไปโดยสิ้นเชิง และถ้าวลี "latent MoE" กลายเป็นว่าอธิบายเพียงบล็อก MoE ธรรมดา ๆ นี่ก็จะเป็นแนวคิดที่เล็กกว่าที่เห็นมากนัก คือแค่การตัดต่อ Nano ขึ้นมาใหม่ด้วยเลเยอร์เชิงเส้นที่ต่างออกไป ไม่ใช่รูปร่างแบบใหม่
สิ่งนี้ทำให้เกิดคำถาม
Gated DeltaNet-2 แตกต่างจาก Gated DeltaNet ที่มีอยู่ใน Qwen3.8 แล้วอย่างไร
Gated DeltaNet รุ่นก่อนหน้าใช้เกตสเกลาร์ตัวเดียวสำหรับทั้งการลบและการเขียน; Gated DeltaNet-2 แยกออกเป็นสองเกตแบบ channel-wise และเพิ่มการลดทอนแบบ channel-wise ที่ยืมมาจาก Kimi Delta Attention ดังนั้นจึงเป็น generalization แบบเข้มงวดมากกว่าจะเป็นการแทนที่ และความแตกต่างในทางปฏิบัติจะปรากฏในการดึงข้อมูล ไม่ใช่ใน perplexity — ช่องว่างใน multi-key needle-in-a-haystack กว้างกว่าช่องว่างใน WikiText มาก
ทำไมใคร ๆ ถึงจะเปลี่ยน Mamba-2 เป็น GDN-2 แทนที่จะแค่เพิ่มเลเยอร์ Mamba-2 ให้มากขึ้นไปเลยล่ะ
เพราะที่ขนาด recurrent state ที่เทียบเคียงกัน งานวิจัยนี้วัดว่า Gated DeltaNet-2 นำหน้าในงาน retrieval ที่เวิร์กโหลดแบบเอเจนต์ที่มีบริบทยาวใช้งานจริง โดยแลกมาด้วยค่าใช้จ่ายคงที่เล็กน้อยในด้าน throughput หากเวิร์กโหลดของคุณเน้น retrieval หนัก การแลกเปลี่ยนนั้นก็คุ้มค่า หากมันผูกกับ throughput ที่บริบทสั้น เบสไลน์ Mamba-2 คือคำตอบที่ประหยัดกว่า การใช้ testbed ขนาด 3B เป็นวิธีที่สมเหตุสมผลในการค้นหาว่า traffic ของคุณมีลักษณะเหมือนแบบใด
การที่ชิ้นส่วนต่าง ๆ เป็นโอเพนซอร์สหมายความว่าโมเดลก็จะเปิดด้วยหรือไม่
ไม่ เวทของ Nemotron-3 Nano เปิด และโค้ดอ้างอิงของ Gated DeltaNet-2 ก็เป็นสาธารณะ แต่ข้อเท็จจริงทั้งสองไม่ได้บังคับให้ใครต้องเผยแพร่เช็กพอยต์ที่สร้างจากสิ่งเหล่านั้น และสัญญาอนุญาตแบบไม่ใช้เชิงพาณิชย์ของโค้ด GDN-2 หมายความว่าการเปิดตัวเชิงพาณิชย์จะต้องมีข้อตกลงที่แตกต่างออกไป ผลลัพธ์ที่เป็นไปได้มีตั้งแต่การเปิดตัวงานวิจัยของ NVIDIA ภายใต้ Nemotron Open Model License ไปจนถึงบางสิ่งที่จะไม่ถูกนำออกจากคลัสเตอร์ภายในเลย
วันนี้มีอะไรน่าลองไหม
ใช่ แต่ไม่ใช่ GDN-2-3B เช็กพอยต์ของเปเปอร์ Gated DeltaNet-2 นั้นทำซ้ำได้จากรีโพซิทอรีของ NVlabs ที่ขนาด 1.3B บน FineWeb-Edu และ Nemotron-3 Nano 30B-A3B กับ 4B ก็รันบน vLLM, SGLang, TensorRT-LLM และ llama.cpp ได้แล้วในตอนนี้ การทดสอบเพียงครึ่งใดครึ่งหนึ่งก็บอกคุณได้ว่าอีกครึ่งหนึ่งน่าจะเป็นอย่างไร ซึ่งให้ข้อมูลมากกว่าที่ทวีตบอกไว้
ไม่มีสิ่งใดในนี้ทำให้ GDN-2-3B กลายเป็นของจริง มันทำให้ GDN-2-3B สามารถถูกพิสูจน์ว่าเป็นเท็จได้ ซึ่งเป็นสิ่งมากที่สุดที่ประโยคเดียวจะให้ได้: ห่างออกไปเพียงไฟล์คอนฟิกหนึ่งไฟล์ คำกล่าวอ้างเกี่ยวกับเอนจินหนึ่งข้อ หรือรีโพซิทอรีหนึ่งแห่ง จากการเป็นได้ทั้งการเปิดตัวจริงในระยะใกล้นี้ หรือการนำส่วนประกอบมาประกอบกันใหม่ที่ฟังดูน่าเชื่อถือแต่ไม่เคยถูกสร้างขึ้นจริง
