การ์ดหัวเรื่องหลักสำหรับบทความข่าว 'NVIDIA-Nemotron-Labs-Teacher-General-Reasoning' แสดงข้อความ 'ครูผู้ให้เหตุผลขนาด 550B เบื้องหลัง Nemotron 3 Ultra ตอนนี้เปิดน้ำหนักแล้ว' พร้อมไอคอนกล่องน้ำหนักเปิด สัญลักษณ์ชิป GPU แท็กเอ็นจิน vLLM / SGLang / TensorRT-LLM ป้ายวันที่ 'เผยแพร่ 14 ส.ค. 2026' และโลโก้ OrcaRouter ประกอบที่มุมขวาล่าง
Engineering & Research

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning: ครูสอนการใช้เหตุผลขนาด 550B ที่อยู่เบื้องหลัง Nemotron 3 Ultra เพิ่งเปิดน้ำหนักโมเดลสู่สาธารณะ

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

เมื่อวันที่ 14 สิงหาคม 2026 NVIDIA ได้เผยแพร่ NVIDIA-Nemotron-Labs-Teacher-General-Reasoning บน Hugging Face ซึ่งเป็นโมเดลเชิงเหตุผลขนาด 550B พารามิเตอร์ที่จนถึงเมื่อวานนี้มีอยู่เฉพาะภายในไปป์ไลน์การฝึกของโมเดลเรือธง Nemotron 3 Ultra เท่านั้น มันคือ "ครูสอน reasoning ทั่วไป" จากสูตร Multi-Teacher On-Policy Distillation (MOPD) ที่ NVIDIA ใช้ฝึกนักเรียน Ultra ขนาด 550B-A55B และการเผยแพร่ครั้งนี้มีความสำคัญด้วยเหตุผลง่ายๆ ข้อเดียว: ในรายงานทางเทคนิคของ Nemotron 3 Ultra ที่ NVIDIA ปล่อยออกมาในเดือนมิถุนายน สูตรการฝึกระบุไว้อย่างชัดเจนว่าเช็คพอยต์ของครูแต่ละคนจะไม่ถูกเปิดเป็นโอเพนซอร์ส แต่ตอนนี้ ตัวนี้ถูกปล่อยออกมาแล้ว — ทั้งน้ำหนัก โทเค็นไนเซอร์ เทมเพลตแชท และคอนฟิกการเสิร์ฟ ภายใต้สัญญาอนุญาต OpenMDW-1.1 ที่เป็นมิตรต่อการใช้งานเชิงพาณิชย์ และมีรุ่นพี่น้องอย่าง NVIDIA-Nemotron-Labs-Teacher-STEM ปล่อยออกมาในวันเดียวกัน ซึ่งดูไม่เหมือนการปล่อยแบบครั้งเดียวจบ แต่เหมือนกับว่ากลุ่มครู (teacher panel) กำลังเริ่มทยอยออกมาแล้ว

แท้จริงแล้วโมเดลครูคืออะไร

MOPD คือเทคนิคการฝึกหลังการเทรน (post-training) ที่ทำให้ Nemotron 3 Ultra มีความสามารถในการให้เหตุผลเชิงเอเจนต์ (agentic reasoning) แทนที่จะกลั่นความรู้จากครูขนาดใหญ่ตัวเดียวลงสู่นักเรียน NVIDIA กลับฝึกครูผู้เชี่ยวชาญเฉพาะด้านมากกว่าสิบตัว — สำหรับการให้เหตุผล การวิจัย การวิเคราะห์ทางกฎหมาย วิศวกรรมซอฟต์แวร์ การใช้เครื่องมือ และด้านอื่นๆ — จากนั้นปล่อยให้นักเรียนสร้างผลลัพธ์ (rollouts) ของตัวเอง แล้วใช้ครูแต่ละคนให้คะแนนผลลัพธ์เหล่านั้นในขอบเขตความเชี่ยวชาญของตน เนื่องจากการให้คะแนนเกิดขึ้นบนผลลัพธ์แบบ on-policy ของนักเรียนเองแทนที่จะเป็นชุดข้อมูลออฟไลน์แบบคงที่ สัญญาณการฝึกจึงสอดคล้องกับสิ่งที่นักเรียนผลิตจริงในเวลาอนุมาน (inference) NVIDIA เรียกวงจรนี้ว่า co-evolution: รอบครูใหม่จะเริ่มต้นจาก checkpoint ของนักเรียนที่อัปเดตล่าสุด ทำให้ทั้งสองฝ่ายพัฒนาขึ้นเรื่อยๆ

เช็คพอยต์นี้คือสมาชิกด้านการให้เหตุผลทั่วไปของคณะผู้เชี่ยวชาญชุดนั้น มันถูกสร้างขึ้นจากนักเรียน Nemotron 3 Ultra ที่ผ่านการเทรนขั้นหลัง โดยผ่านการเทรน SFT และการเรียนรู้แบบเสริมกำลังที่เน้นการให้เหตุผลเพิ่มอีกหนึ่งรอบ และการ์ดโมเดลระบุว่ามันถูกปรับให้เหมาะสมสำหรับ{{1}}ร่องรอยการให้เหตุผล{{/1}}ที่ยาวและมีคุณภาพสูงใน{{2}}ปัญหาหลายขั้นตอนที่ยากที่สุด{{/2}} ครอบคลุมคณิตศาสตร์ ตรรกะ และการให้เหตุผลเชิงนามธรรม—รวมถึงการพิสูจน์เชิงรูปแบบและการเขียนโค้ดเชิงแข่งขัน ภายใน MOPD มันทำหลายบทบาทพร้อมกัน เช็คพอยต์เดียว หลายบทบาท: {{3}}การสร้างร่องรอยการให้เหตุผล การตัดสินคณิตศาสตร์{{/3}} และ{{4}}ตัวตัดสินความเท่าเทียม{{/4}}ที่ให้คะแนนคำตอบสั้นแบบอิสระเทียบกับคำตอบอ้างอิง NVIDIA ยังจัดจำหน่ายมันแบบสแตนด์อโลนด้วย เพราะมันเป็นผู้ให้เหตุผลที่แข็งแกร่งในตัวของมันเอง—{{5}}ออกแบบมาสำหรับการสร้างร่องรอยการให้เหตุผลระยะยาว การแก้ปัญหาที่ยาก{{/5}} และการทำหน้าที่เป็นครูหรือผู้ให้คะแนนภายในไปป์ไลน์การกลั่นความรู้ของคุณเอง

สเปกในครั้งเดียว

• พารามิเตอร์ — รวม 550B / ใช้งาน 55B, sparse LatentMoE

• สถาปัตยกรรม — Mamba2-Transformer แบบไฮบริด latent mixture-of-experts พร้อมการทำนายหลายโทเคน (MTP)

• หน้าต่างบริบท — สูงสุด 1M โทเคน; ค่าเริ่มต้น 256K ในการกำหนดค่าการให้บริการอ้างอิง

• ภาษา — 10: อังกฤษ, ฝรั่งเศส, สเปน, อิตาลี, เยอรมัน, ญี่ปุ่น, ฮินดี, เกาหลี, โปรตุเกส (บราซิล), จีน

• ใบอนุญาต — OpenMDW-1.1 อนุญาตให้ใช้ทั้งในเชิงพาณิชย์และไม่เชิงพาณิชย์

• ฮาร์ดแวร์ขั้นต่ำ — 4×B200 (น้ำหนัก NVFP4); รองรับ GB200/GB300 และ H100-class ด้วย

สถาปัตยกรรมนี้อยู่ในตระกูลเดียวกันกับ Nemotron 3 Ultra เอง: รูปทรง 550B-A55B ที่มีเลเยอร์ Mamba-2 และ MoE สลับกัน, เลเยอร์ attention ที่เลือกไว้, และหัว MTP สำหรับการถอดรหัสแบบ speculative แบบเนทีฟ ครูไม่ใช่นักเรียนที่เล็กกว่า — มันเป็นตัวแปรที่ได้รับการฝึกต่างกันของสแตกเดียวกัน, เชี่ยวชาญสำหรับการให้เหตุผลระยะยาวมากกว่างานแบบ agentic ทั่วไป

A single-column scoreboard for NVIDIA-Nemotron-Labs-Teacher-General-Reasoning listing 550B total / 55B active parameters, LatentMoE Mamba2-Transformer hybrid + MTP architecture, up to 1M token context, 10 languages, OpenMDW-1.1 commercial license, and vLLM / SGLang / TensorRT-LLM serving, with a footer noting the specs are per NVIDIA's model card and no independent benchmarks exist yet, and the OrcaRouter logo composited in the corner.

ทำไมการเปิดซอร์สครูจึงสำคัญ

Teacher checkpoints คือรูปแบบการเปิดเผยโมเดลที่หายากที่สุด บริษัทต่าง ๆ เผยแพร่ student — โมเดลที่คุณนำไปใช้งานจริง — และชุดข้อมูลอยู่ตลอดเวลา แต่แทบไม่เคยเผยแพร่โมเดลที่ใช้ตรวจให้คะแนนผลงานของ student เลย นั่นคือเหตุผลที่บรรทัดในรายงานเดือนมิถุนายนที่ระบุว่า per-teacher checkpoints จะไม่ถูกเผยแพร่นั้น ถูกอ่านว่ากำลังปิดประตูสู่การทำซ้ำไปป์ไลน์ MOPD ตั้งแต่ต้นจนจบ การเผยแพร่ครั้งนี้เปิดประตูบานนั้นออก อย่างน้อยก็สำหรับ reasoning teacher

สำหรับทีมที่สร้างโมเดลการให้เหตุผลของตนเอง นี่คือคุณค่าที่เป็นรูปธรรม สัญญาณรางวัลที่หล่อหลอมการให้เหตุผลของ Nemotron 3 Ultra บางส่วนถูกเขียนขึ้นโดย checkpoint นี้ และตอนนี้สามารถนำไปศึกษาตรงๆ ใช้เป็นผู้ตัดสิน หรือใช้สร้าง traces การให้เหตุผลระยะยาวสำหรับข้อมูล SFT เมื่อรวมกับข้อมูล post-training ที่เปิดเผยอยู่แล้ว (nvidia/nemotron-post-training-v3) และสูตรการฝึกที่เผยแพร่ ก็ช่วยทำให้ช่องว่างระหว่าง "NVIDIA ฝึกโมเดลที่ยอดเยี่ยม" กับ "เราสามารถฝึกโมเดลแบบนั้นได้" แคบลง

A screenshot of the Hugging Face model page for nvidia/NVIDIA-Nemotron-Labs-Teacher-General-Reasoning showing the model card summary: 550B total / 55B active parameters, LatentMoE hybrid Mamba-2 + MoE + Attention with MTP architecture, up to 1M token context, minimum GPU requirements, supported languages, the openmdw-1.1 license tag, and the files and versions listing.

หน้าปัดการคิด

คุณลักษณะเด่นอย่างหนึ่งที่สืบทอดมาจากตระกูล Nemotron 3 คือ การใช้เหตุผลเป็นสวิตช์ ไม่ใช่ค่าเริ่มต้น เทมเพลตแชทรองรับ enable_thinking=true/false ตัวเลือก medium_effort และเพดานโทเค็น reasoning_budget ดังนั้นผู้เรียกใช้จึงสามารถบังคับให้ใช้การให้เหตุผลเชิงลึกระยะยาวเมื่อปัญหาต้องการ และได้คำตอบตรงไปตรงมา—เร็วขึ้นและถูกกว่า—เมื่อไม่ต้องการ สำหรับโมเดลครู (teacher model) เรื่องนี้สำคัญมากกว่าที่เห็น: การกลั่นโมเดลต้องการรอบการให้คะแนนราคาถูกสำหรับตัวอย่างง่าย และต้องการร่องรอยการให้เหตุผลที่มีค่าใช้จ่ายสูงสำหรับตัวอย่างยาก และเช็คพอยต์เดียวที่รองรับทั้งสองโหมดช่วยขจัดความจำเป็นในการสลับโมเดลกลางไปป์ไลน์

กำลังรันมัน

นี่ไม่ใช่โมเดลที่คุณจะเรียกใช้แบบไม่ได้เตรียมการ การตั้งค่าการให้บริการขั้นต่ำที่สมเหตุสมผลคือ 4×B200 พร้อมน้ำหนัก NVFP4 และแคช KV แบบ fp8; การกำหนดค่าอ้างอิงยังครอบคลุมระบบ multi-node GB200/GB300 และเครื่องระดับ H100 ด้วย NVIDIA เผยแพร่คู่มือการตั้งค่า (cooking guides) สำหรับเอนจินสามตัว ได้แก่ vLLM (0.22), SGLang (0.5.13) และ TensorRT-LLM (1.3.0rc17) — ทั้งหมดเปิดใช้ API ที่เข้ากันได้กับ OpenAI บนพอร์ต 8000 พร้อมกับการถอดรหัสแบบคาดเดา (speculative decoding) ด้วย MTP หรือ EAGLE และแบ็กเอนด์ flashinfer Mamba คอนเท็กซ์ขนาด 1M โทเคนจำเป็นต้องมีแฟล็กอนุญาตอย่างชัดเจนในแต่ละเอนจิน (VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 และค่าที่เทียบเท่า); ค่าเพดานเริ่มต้นคือ 256K

ณ เวลาที่เขียนบทความนี้ โมเดลดังกล่าวยังไม่ถูกปรับใช้โดยผู้ให้บริการอินเฟอเรนซ์รายใดบน Hugging Face และ NVIDIA ยังไม่ได้ประกาศการโฮสต์ NIM — นี่คือการเผยแพร่แบบ weights-only ซึ่งทำให้มันเป็นโมเดลสำหรับห้องแล็บที่รันคลัสเตอร์ GPU ขนาดใหญ่อยู่แล้ว หรือสำหรับทีมที่ไปป์ไลน์การกลั่น (distillation pipeline) ต้องการสัญญาณ teacher ที่แม่นยำโดยเฉพาะ เมื่อมันถูกวางบน managed API ในที่สุด การคำนวณราคาก็ง่าย: นี่คือ MoE ที่มีแอคทีฟพารามิเตอร์ 55B และใครก็ตามที่โฮสต์มันจะคิดค่าใช้จ่ายตามต้นทุน GPU บนเลเยอร์การจัดเส้นทางที่คิดมาร์กอัป 0% คุณจ่ายตามราคารายการของผู้ให้บริการโดยไม่มีค่าธรรมเนียมแพลตฟอร์มเพิ่มเติม — และคีย์เดียวกันที่เข้าถึงโมเดลนี้ก็เข้าถึงโมเดลระดับแนวหน้าที่คุณนำเทรซมาเปรียบเทียบด้วย พร้อมการเฟลโอเวอร์อัตโนมัติหากโฮสต์หลุด นั่นคือส่วนที่เราเตอร์อย่าง OrcaRouter มีไว้; ส่วนตัว teacher เองคือส่วนที่คุณโฮสต์ด้วยตัวเอง

คำเตือนที่ตรงไปตรงมา

นี่คือ checkpoint ที่มีอายุเพียง 24 ชั่วโมง และ model card ไม่มีตัวเลข benchmark เลย นั่นไม่ใช่การละเว้นในเอกสารนี้ — แต่เป็นสถานะของการเผยแพร่ครั้งนี้ NVIDIA เผยแพร่รายละเอียดสถาปัตยกรรมและการฝึกฝน แต่ไม่มีตารางการประเมิน และยังไม่มีห้องปฏิบัติการอิสระใดที่มีเวลาทดสอบมัน จุดอ้างอิงที่ใกล้เคียงที่สุดคือตัวเลขที่ผู้พัฒนารายงานสำหรับ student โมเดล: Nemotron 3 Ultra รายงาน 71.9 บน SWE-Bench Verified, 86.8 บน MMLU-Pro, 89.0 บน LiveCodeBench v6 และประมาณ 95 บน RULER ที่บริบท 1M ตัวเลขเหล่านั้นอธิบายถึง Ultra student ไม่ใช่ teacher ตัวนี้ และเป็นตัวเลขของ NVIDIA เอง ใครก็ตามที่วางแผนจะทำ distillation บน checkpoint นี้ ควรถือว่าคุณภาพการให้เหตุผลของมันยังไม่ได้รับการยืนยัน จนกว่าจะมีคะแนนจากหน่วยงานอิสระปรากฏขึ้น

ยังมีข้อควรระวังอีกสองข้อที่ถูกฝังไว้ในการ์ด คลังข้อมูลหลังการฝึกมีน้ำหนักไปทางภาษาอังกฤษอย่างมาก — มีตัวอย่างภาษาอังกฤษประมาณ 8.6 ล้านตัวอย่าง เทียบกับประมาณ 138,000 ตัวอย่างต่อภาษาในอีกเก้าภาษาที่เหลือ — ดังนั้นคุณภาพการให้เหตุผลแบบหลายภาษาจึงไม่ควรประเมินจากป้ายกำกับ 10 ภาษา และการ์ดเองก็ชี้ให้เห็นถึงความไม่สมดุลของการเป็นตัวแทนในชุดข้อมูลฝึกพื้นฐาน พร้อมทั้งแนะนำให้ตรวจสอบอคติก่อนนำไปใช้ในงานปลายทาง

ใครควรสนใจ

สามกลุ่มได้รับคุณค่าที่แท้จริงตรงนี้ นักวิจัยด้าน distillation ในที่สุดก็มีครู MOPD ตัวจริงให้แยกแยะศึกษา ไม่ใช่แค่สูตรที่อธิบายไว้ ห้องแล็บที่ฝึกโมเดล reasoning ของตัวเองจะได้ตัวสร้าง trace ระยะยาวและตัวตัดสินที่มาจาก post-training lineage เดียวกันกับโมเดลที่พวกเขาพยายามจะเทียบเคียง และใครก็ตามที่ทำ on-policy RL ก็สามารถใช้มันได้แบบที่ NVIDIA ทำ — เป็นตัวให้คะแนนสำหรับปัญหาที่ยากที่สุด โดยเปิดใช้การคิดเฉพาะจุดที่คุ้มค่าเท่านั้น

หากคุณไม่อยู่ในกลุ่มใดกลุ่มหนึ่งเหล่านี้ การเปิดตัวครั้งนี้เปลี่ยนแปลงเพียงเล็กน้อยสำหรับคุณในวันนี้: โมเดลมีขนาดใหญ่ ยังไม่ผ่านการพิสูจน์ และรองรับเฉพาะ self-host เท่านั้น และวิธีที่เร็วที่สุดในการตอบสนองต่อแนวโน้มพื้นฐาน — การเกิดขึ้นของครูสอนการให้เหตุผลแบบเปิดมากขึ้น — คือการทำให้เลเยอร์โมเดลของไปป์ไลน์ของคุณสามารถสลับเปลี่ยนได้ภายใต้อินเทอร์เฟซเดียว แทนที่จะยึดติดอยู่กับเช็คพอยต์ตัวใดตัวหนึ่ง

A flow diagram titled 'How Multi-Teacher On-Policy Distillation works' showing a Student (Nemotron 3 Ultra) node sending rollouts to a Teacher panel of 10+ domain specialist cards, one highlighted as the General Reasoning teacher released Aug 14, 2026, with reward signals flowing back to the student, and the OrcaRouter logo composited in the corner.

สิ่งที่ควรดูต่อไป

สามสิ่งจะบอกว่านี่เป็นเหตุการณ์ครั้งเดียวหรือว่ากลุ่มกำลังจะเปิดตัว ประการแรก ไม่ว่าโมเดลครูตัวอื่นๆ จะทำตามแนวทางเดียวกันหรือไม่ — NVIDIA-Nemotron-Labs-Teacher-STEM เปิดตัวในวันเดียวกันแล้ว ดังนั้นคำถามคือ ผู้เชี่ยวชาญเฉพาะด้านตัวใดจะตามมา และพวกมันจะถูกถ่วงน้ำหนักในแบบเดียวกันหรือไม่ ประการที่สอง ไม่ว่า NVIDIA NIM หรือโฮสต์ที่ได้รับการจัดการจะเริ่มให้บริการพวกมันหรือไม่ ซึ่งจะเปลี่ยนการเปิดตัวที่จำกัดเฉพาะแล็บให้เป็นสิ่งที่อุตสาหกรรมที่เหลือสามารถเรียกใช้ได้จริง ประการที่สาม ไม่ว่าจะมีการวัดมาตรฐานอิสระปรากฏขึ้นหรือไม่ — การปรากฏใน Artificial Analysis หรือการรันใน LMArena จะเป็นการตรวจสอบจริงครั้งแรกว่าคุณภาพการให้เหตุผลของครูตรงกับนักเรียนที่มันฝึกหรือไม่

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube