การ์ดไตเติลหลักสำหรับบทความเปรียบเทียบ 'NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max' ที่มีข้อความ 'สัปดาห์ที่โอเพนเวตเริ่มจริงจัง' พร้อมไอคอนหมวกจบการศึกษาในกล่องเปิดทางด้านซ้าย ไอคอนลูกโลกและชิปทางด้านขวา ป้ายเปรียบเทียบโมเดล และโลโก้ OrcaRouter ประกอบอยู่ที่มุมขวาล่าง
Guides & Insights

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning เทียบกับ Qwen3.8-Max: สัปดาห์ที่โอเพนเวตเอาจริง

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

โอเพนเวตเพิ่งมีสัปดาห์ที่ยิ่งใหญ่ ในหรือประมาณวันที่ 12 สิงหาคม 2026 Alibaba ปล่อย Qwen ระดับ Max-class แบบเปิดน้ำหนักเป็นครั้งแรก — Qwen3.8 Max โมเดลเรือธงขนาด 2.4 ล้านล้านพารามิเตอร์ เผยแพร่ในชื่อ Qwen3.8-2.4T-A95B บน Hugging Face และ ModelScope สองวันต่อมา ในวันที่ 14 สิงหาคม NVIDIA เผยแพร่ NVIDIA-Nemotron-Labs-Teacher-General-Reasoning โมเดลครูสำหรับการให้เหตุผลขนาด 550B พารามิเตอร์ ใช้งานจริง 55B พารามิเตอร์ จากกระบวนการเทรน Nemotron 3 Ultra บน Hugging Face เช่นกัน ทั้งคู่เป็นเช็คพอยต์ขนาดมหึมาที่เพิ่งถูกเปิดใหม่จากห้องแล็บระดับแนวหน้า และความคล้ายคลึงก็มีเพียงแค่นั้น Qwen3.8 Max เปิดให้คุณรันโมเดลระดับแนวหน้าได้ด้วยตัวเอง ส่วน NVIDIA-Nemotron-Labs-Teacher-General-Reasoning เปิดให้คุณใช้มันเพื่อเทรนได้ การเปรียบเทียบทั้งสองนั้นแท้จริงแล้วคือการถามว่าคุณเป็นทีมแบบไหน — แต่ความจริงที่ทั้งคู่เปิดตัวภายใน 72 ชั่วโมงเป็นสัญญาณว่าอุตสาหกรรมกำลังมุ่งหน้าไปทางไหน

แต่ละเวอร์ชันที่เผยแพร่ออกมาจริงๆ แล้วมีอะไรบ้าง

Qwen3.8 Max คือเวอร์ชันที่นำไปใช้งานจริงได้ เป็นโมเดล sparse mixture-of-experts ที่มีพารามิเตอร์รวม 2.4 ล้านล้านตัว โดยมีพารามิเตอร์ที่ทำงานจริงประมาณ 95 พันล้านตัวต่อโทเค็นใน 512 ผู้เชี่ยวชาญ สร้างบนสถาปัตยกรรมไฮบริดตระกูล Qwen3.5 ในรูปแบบ open-weights โมเดลรองรับเฉพาะข้อความ มีบริบทดั้งเดิม 262K โทเค็น (ขยายได้เกิน 1M) และที่สำคัญคือ ต้องใช้โหมดคิด: โมเดลจะส่งเนื้อหาการให้เหตุผลระหว่างแท็ก <think> และไม่สามารถปิดได้ เวอร์ชัน API ที่โฮสต์ให้บริการซึ่ง Alibaba เปิดตัวเมื่อวันที่ 3 สิงหาคม เพิ่มการรับอินพุตรูปภาพและวิดีโอ บริบทเริ่มต้น 1M และโหมดคิดแบบเลือกได้ สัญญาอนุญาต open-weights เป็น Qwen3.8 Max License ที่กำหนดขึ้นเอง ให้สิทธิ์แบบเสรีแต่มีเงื่อนไขตามรายได้สำหรับการใช้งานเชิงพาณิชย์ขนาดใหญ่ หากคุณมีฮาร์ดแวร์หลายโหนด ก็สามารถรันโมเดลระดับแนวหน้าบนโครงสร้างพื้นฐานของตนเองได้

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning คือเวอร์ชันสำหรับช่วงการฝึก (training-time) โดยเป็นหนึ่งในครูผู้เชี่ยวชาญเฉพาะโดเมนมากกว่าสิบตัวจากสูตรการกลั่นแบบ Multi-Teacher On-Policy Distillation (MOPD) ที่อยู่เบื้องหลัง Nemotron 3 Ultra ซึ่งได้มาจากตัวนักเรียน (student) แบบ Ultra หลังการฝึก (post-trained) ผ่านขั้นตอน SFT ที่เชี่ยวชาญด้านการใช้เหตุผลและการเรียนรู้ด้วยการเสริมแรงเพิ่มเติม บทบาทของมันในไปป์ไลน์นั้นคือการสร้างร่องรอยการใช้เหตุผลแบบยาว (long reasoning traces) สำหรับโจทย์คณิตศาสตร์ ตรรกะ และการใช้เหตุผลเชิงนามธรรมที่ยากที่สุด รวมถึงทำหน้าที่เป็นผู้ตัดสินที่ให้คะแนนคำตอบแบบอิสระ (free-form answers) โมเดลนี้เผยแพร่ภายใต้ไลเซนส์ OpenMDW-1.1 ที่เป็นมิตรต่อการใช้งานเชิงพาณิชย์ พร้อมข้อมูลการฝึกหลังการฝึกที่เปิดเผย และไม่มีตัวเลข benchmark ใด ๆ เลย — NVIDIA ชี้ไปที่กราฟความแม่นยำและรายงานทางเทคนิคของ Ultra แทน ลูกค้าของมันคือการรันการกลั่น (distillation runs) ไม่ใช่ปริมาณงานในระบบ production

Qwen3.8 Max เรือธงระดับ Max-class แบบเปิดเป็นรุ่นแรก

การเปิดตัวของ Alibaba มีความสำคัญ เพราะโมเดลระดับ Max-class ของ Qwen ในอดีตนั้นใช้งานได้ผ่าน API เท่านั้น Qwen3.8 Max ทำลายข้อจำกัดนั้น: น้ำหนักของโมเดลสามารถดาวน์โหลดได้ และโมเดลดังกล่าวเป็นโมเดลระดับแนวหน้าอย่างแท้จริง — Artificial Analysis ให้คะแนน Intelligence Index ที่ 58 และ Agentic Index ที่ 58 ซึ่งเท่ากับผู้ให้บริการแบบปิดชั้นนำในงานแบบ agentic จุดเด่นที่ผู้ให้บริการรายงานนั้นแข็งแกร่ง: 93.0 ใน PaperBench (นำหน้า GPT-5.6 Sol และ Fable 5), 92.6 ใน GPQA Diamond, 86.1 ใน OSWorld-Verified จุดอ่อนของมันก็มีอยู่จริงเช่นกัน — 67.7 ใน SWE-bench Pro และ 43.6 ใน Humanity's Last Exam ตามหลังผู้นำ และการทดสอบอิสระพบว่ามีต้นทุนสูงต่องานที่สำเร็จ โดยเฉลี่ย 64 รอบต่องานในการรันแบบ agentic บน API ของ Alibaba มีราคาอยู่ที่ 2.00 ดอลลาร์ต่อล้านโทเคนนำเข้า, 6.00 ดอลลาร์ต่อล้านโทเคนเอาต์พุต และ 0.25 ดอลลาร์ต่อล้านโทเคนอินพุตที่ถูกแคช ซึ่งลดลง 20% จากราคาพรีวิว

โมเดลครู: โครงสร้างพื้นฐานการฝึกอบรมพร้อมด้วยการ์ดโมเดล

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning ไม่ได้แข่งขันในเรื่องตัวเลขเหล่านั้น เพราะมันไม่ได้เผยแพร่ตัวเลขใดๆ สิ่งที่มันนำเสนอแทนคือสถาปัตยกรรมไฮบริด LatentMoE Mamba-2 + Transformer แบบเดียวกับนักเรียน Ultra รองรับบริบทได้สูงสุด 1M โทเคน และมีปุ่มปรับระดับการให้เหตุผล — enable_thinking true/false, โหมด medium_effort, และเพดาน reasoning_budget แบบ hard — ซึ่งไปป์ไลน์การกลั่นจำเป็นต้องใช้เพื่อใช้เหตุผลเชิงลึกกับตัวอย่างยาก และข้ามไปสำหรับตัวอย่างง่าย ฮาร์ดแวร์ขั้นต่ำคือ 4×B200 (หรือ 8×H100) ให้บริการผ่าน vLLM, SGLang, หรือ TensorRT-LLM และ checkpoint มีขนาดดาวน์โหลด 1.12 เทระไบต์ มันไม่ได้ถูกใช้งานโดยผู้ให้บริการ inference รายใด และ NVIDIA ยังไม่ได้ประกาศการโฮสต์ NIM นี่คือการเผยแพร่แบบ weights-only ที่มุ่งเป้าไปที่ห้องปฏิบัติการที่รันฝูง GPU ขนาดใหญ่อยู่แล้ว

สเปก, เคียงข้างกัน

• วัตถุประสงค์ — Teacher: ผู้เชี่ยวชาญด้านการให้เหตุผลระหว่างการฝึกอบรมและผู้ตัดสิน Qwen3.8 Max: เรือธงระดับแนวหน้าพร้อมใช้งาน

• สเกล — Teacher: รวม 550B / ใช้งาน 55B, LatentMoE พร้อม MTP. Qwen3.8 Max: รวม 2.4T / ~95B ใช้งาน, 512 เอ็กซ์เพิร์ต, Qwen3.5 แบบไฮบริด.

• บริบท — Teacher: รองรับสูงสุด 1M โทเค็น, ค่าเริ่มต้น 256K. Qwen3.8 Max: บริบท open-weights ดั้งเดิม 262K, ขยายได้เกิน 1M; เวอร์ชัน API ค่าเริ่มต้น 1M.

• น้ำหนัก — ผู้สอน: OpenMDW-1.1 เผยแพร่เมื่อ 14 ส.ค. 2026. Qwen3.8 Max: Qwen3.8 Max License เผยแพร่เมื่อ ~12 ส.ค. 2026.

• หลักฐานอิสระ — ครู: ยังไม่มี Qwen3.8 Max: AA Intelligence Index 58, Agentic Index 58, Coding Index 71.8.

• การคิด — Teacher: สลับ enable_thinking, medium_effort, เพดาน reasoning_budget. Qwen3.8 Max: บังคับเปิดใน open weights, ไม่สามารถปิดได้

• ราคา — Teacher: ไม่มีราคาประกาศ, capex สำหรับการโฮสต์เอง Qwen3.8 Max: $2.00 / $6.00 ต่อล้านโทเคน, $0.25 สำหรับอินพุตที่แคช

A two-column scoreboard for NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max. Left column (Nemotron Teacher): training-time reasoning teacher, 55B active (550B total), up to 1M context, OpenMDW-1.1 weights, no independent score yet, self-hosted capex. Right column (Qwen3.8-Max): deployable frontier, 95B active (2.4T total), 262K native context extendable past 1M, Qwen3.8-Max License weights, AA Intelligence Index 58, $2.00/$6.00 per million tokens. Footer notes Qwen figures per Alibaba (vendor-reported) + Artificial Analysis and teacher specs unaudited. OrcaRouter logo composited bottom-right.A screenshot of the Hugging Face model page for nvidia/NVIDIA-Nemotron-Labs-Teacher-General-Reasoning showing the model card: 550B total / 55B active parameters, LatentMoE hybrid Mamba-2 + MoE + Attention with MTP, up to 1M token context, 10 languages, the OpenMDW-1.1 license tag, and the files and versions listing.

ความไม่สมดุลของหลักฐานคือเรื่องทั้งหมด

Qwen3.8 Max ได้รับการทดสอบแล้ว แต่โมเดลครูยังไม่ได้รับการทดสอบ ส่วนหนึ่งเป็นเพราะอายุ — Qwen3.8 Max เปิดตัวเมื่อวันที่ 3 สิงหาคม และมีการรันบนลีดเดอร์บอร์ดมาเป็นเวลาสองสัปดาห์แล้ว ในขณะที่โมเดลครูเพิ่งเปิดตัวเมื่อวานนี้ — และอีกส่วนหนึ่งเป็นเพราะความตั้งใจ เนื่องจากการ์ดของโมเดลครูไม่เคยถูกสร้างขึ้นมาเพื่อแข่งขันด้านคะแนน แต่ความไม่สมมาตรนี้ส่งผลจริงต่อการเปรียบเทียบ: ตัวเลขที่เป็นรูปธรรมทุกตัวบนหน้านี้ที่มีแหล่งอ้างอิงเป็นของ Qwen3.8 Max และตัวเลขทุกตัวที่อ้างถึงโมเดลครูเป็นสเปกสถาปัตยกรรม คุณภาพการให้เหตุผลของโมเดลครูยังไม่ได้รับการตรวจสอบโดยใครนอกเหนือจาก NVIDIA และตัวเลขระดับตระกูลของมัน (ค่าที่ผู้ผลิตแจ้งสำหรับนักเรียน Ultra: SWE-Bench Verified 71.9, MMLU-Pro 86.8, LiveCodeBench v6 89.0) บรรยายถึงโมเดลที่ต่างออกไป ใครก็ตามที่กำลังตัดสินใจจากคำถามที่ว่า "อันไหนทำคะแนนได้ดีกว่า" ต้องรอการทดสอบอิสระของโมเดลครู ซึ่งเป็นช่องว่างที่สองสามสัปดาห์ข้างหน้าควรจะปิดลง

หน้าปัดที่คิดสองอัน ตั้งค่าแตกต่างกัน

ความแตกต่างทางเทคนิคที่น่าสนใจที่สุดระหว่างสองเวอร์ชันนี้คือสิ่งที่เกิดขึ้นเมื่อคุณขอให้พวกมันใช้เหตุผล Qwen3.8 Max ในรูปแบบ open-weights ไม่มีทางเลือก: การคิดเปิดอยู่เสมอ และ trace การให้เหตุผลเป็นส่วนหนึ่งของทุกคำตอบ ซึ่งดีต่อคุณภาพและความโปร่งใสของคำตอบ แต่มีค่าใช้จ่ายสูงสำหรับการสร้างจำนวนมาก โมเดลครูปฏิบัติต่อการให้เหตุผลเหมือนปุ่มปรับ: enable_thinking สลับมัน, medium_effort จำกัดความเร็ว และ reasoning_budget เป็นเพดานที่จำกัดมัน สำหรับไปป์ไลน์การกลั่น ความแตกต่างนี้ชี้ขาด — การสร้าง trace การให้เหตุผลหลายล้านรายการด้วยโมเดลที่คิดตลอดเวลาจะทำให้ค่าใช้จ่ายโทเคนของคุณทวีคูณ ในขณะที่สวิตช์ของโมเดลครูช่วยให้คุณจ่ายสำหรับการคิดเชิงลึกเฉพาะเมื่อตัวอย่างที่ยากต้องการมันเท่านั้น สิ่งเหล่านี้ไม่ใช่ปรัชญาการออกแบบที่แข่งขันกัน แต่เป็นเครื่องมือสองอย่างที่ปรับให้เหมาะกับปลายทางที่ตรงกันข้ามของปัญหาเดียวกัน และแต่ละอย่างคือเครื่องมือที่เหมาะสมสำหรับปลายทางของมัน

A screenshot of the OrcaRouter model page for Qwen3.8-Max (Qwen) showing the model header, the qwen/qwen3.8-max slug, and the pricing, performance, and public-benchmarks tabs.

สรุป

หากคุณต้องการรันโมเดลระดับแนวหน้าบนฮาร์ดแวร์ของคุณเอง — หรือเรียกใช้ที่ราคาสมเหตุสมผล — Qwen3.8 Max คือรุ่นที่สำคัญ และมันอยู่บน OrcaRouter ในราคารายการของ Alibaba ส่งผ่านโดยไม่บวกเพิ่ม 0% ดังนั้นการลดราคาที่ Alibaba ประกาศตอนเปิดตัวจึงมีผลบนฝั่งของเราในวันเดียวกัน หากคุณต้องการเทรนหรือดิสทิลโมเดลให้เหตุผล — หรือตรวจสอบสัญญาณที่หล่อหลอม Nemotron 3 Ultra — NVIDIA-Nemotron-Labs-Teacher-General-Reasoning คือรุ่นที่สำคัญ และในตอนนี้รองรับเฉพาะการโฮสต์เองเท่านั้น เรื่องที่ใหญ่กว่าคือทั้งคู่เปิดตัวในสัปดาห์เดียวกัน: โมเดลโอเพนเวตเพิ่งเปลี่ยนจาก "เปิดพอที่จะดูได้" ไปเป็น "เปิดพอที่จะสร้างต่อได้" ณ จุดสองจุดที่แตกต่างกันในห่วงโซ่อุปทานของโมเดล ทีมที่ทำให้ชั้นโมเดลของตนสลับเปลี่ยนได้ภายใต้อินเทอร์เฟซเดียว — การเทรนแบบโฮสต์เองในด้านหนึ่ง การอินเฟอเรนซ์ระดับแนวหน้าแบบบริการจัดการในอีกด้านหนึ่ง — คือทีมที่อยู่ในจุดที่พร้อมใช้ทั้งสองอย่าง

การเปรียบเทียบในบทความนี้2

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube