
NVIDIA-Nemotron-Labs-Teacher-General-Reasoning เทียบกับ Qwen3.8-Max: สัปดาห์ที่โอเพนเวตเอาจริง
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 114 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 367 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
โอเพนเวตเพิ่งมีสัปดาห์ที่ยิ่งใหญ่ ในหรือประมาณวันที่ 12 สิงหาคม 2026 Alibaba ปล่อย Qwen ระดับ Max-class แบบเปิดน้ำหนักเป็นครั้งแรก — Qwen3.8 Max โมเดลเรือธงขนาด 2.4 ล้านล้านพารามิเตอร์ เผยแพร่ในชื่อ Qwen3.8-2.4T-A95B บน Hugging Face และ ModelScope สองวันต่อมา ในวันที่ 14 สิงหาคม NVIDIA เผยแพร่ NVIDIA-Nemotron-Labs-Teacher-General-Reasoning โมเดลครูสำหรับการให้เหตุผลขนาด 550B พารามิเตอร์ ใช้งานจริง 55B พารามิเตอร์ จากกระบวนการเทรน Nemotron 3 Ultra บน Hugging Face เช่นกัน ทั้งคู่เป็นเช็คพอยต์ขนาดมหึมาที่เพิ่งถูกเปิดใหม่จากห้องแล็บระดับแนวหน้า และความคล้ายคลึงก็มีเพียงแค่นั้น Qwen3.8 Max เปิดให้คุณรันโมเดลระดับแนวหน้าได้ด้วยตัวเอง ส่วน NVIDIA-Nemotron-Labs-Teacher-General-Reasoning เปิดให้คุณใช้มันเพื่อเทรนได้ การเปรียบเทียบทั้งสองนั้นแท้จริงแล้วคือการถามว่าคุณเป็นทีมแบบไหน — แต่ความจริงที่ทั้งคู่เปิดตัวภายใน 72 ชั่วโมงเป็นสัญญาณว่าอุตสาหกรรมกำลังมุ่งหน้าไปทางไหน
แต่ละเวอร์ชันที่เผยแพร่ออกมาจริงๆ แล้วมีอะไรบ้าง
Qwen3.8 Max คือเวอร์ชันที่นำไปใช้งานจริงได้ เป็นโมเดล sparse mixture-of-experts ที่มีพารามิเตอร์รวม 2.4 ล้านล้านตัว โดยมีพารามิเตอร์ที่ทำงานจริงประมาณ 95 พันล้านตัวต่อโทเค็นใน 512 ผู้เชี่ยวชาญ สร้างบนสถาปัตยกรรมไฮบริดตระกูล Qwen3.5 ในรูปแบบ open-weights โมเดลรองรับเฉพาะข้อความ มีบริบทดั้งเดิม 262K โทเค็น (ขยายได้เกิน 1M) และที่สำคัญคือ ต้องใช้โหมดคิด: โมเดลจะส่งเนื้อหาการให้เหตุผลระหว่างแท็ก <think> และไม่สามารถปิดได้ เวอร์ชัน API ที่โฮสต์ให้บริการซึ่ง Alibaba เปิดตัวเมื่อวันที่ 3 สิงหาคม เพิ่มการรับอินพุตรูปภาพและวิดีโอ บริบทเริ่มต้น 1M และโหมดคิดแบบเลือกได้ สัญญาอนุญาต open-weights เป็น Qwen3.8 Max License ที่กำหนดขึ้นเอง ให้สิทธิ์แบบเสรีแต่มีเงื่อนไขตามรายได้สำหรับการใช้งานเชิงพาณิชย์ขนาดใหญ่ หากคุณมีฮาร์ดแวร์หลายโหนด ก็สามารถรันโมเดลระดับแนวหน้าบนโครงสร้างพื้นฐานของตนเองได้
NVIDIA-Nemotron-Labs-Teacher-General-Reasoning คือเวอร์ชันสำหรับช่วงการฝึก (training-time) โดยเป็นหนึ่งในครูผู้เชี่ยวชาญเฉพาะโดเมนมากกว่าสิบตัวจากสูตรการกลั่นแบบ Multi-Teacher On-Policy Distillation (MOPD) ที่อยู่เบื้องหลัง Nemotron 3 Ultra ซึ่งได้มาจากตัวนักเรียน (student) แบบ Ultra หลังการฝึก (post-trained) ผ่านขั้นตอน SFT ที่เชี่ยวชาญด้านการใช้เหตุผลและการเรียนรู้ด้วยการเสริมแรงเพิ่มเติม บทบาทของมันในไปป์ไลน์นั้นคือการสร้างร่องรอยการใช้เหตุผลแบบยาว (long reasoning traces) สำหรับโจทย์คณิตศาสตร์ ตรรกะ และการใช้เหตุผลเชิงนามธรรมที่ยากที่สุด รวมถึงทำหน้าที่เป็นผู้ตัดสินที่ให้คะแนนคำตอบแบบอิสระ (free-form answers) โมเดลนี้เผยแพร่ภายใต้ไลเซนส์ OpenMDW-1.1 ที่เป็นมิตรต่อการใช้งานเชิงพาณิชย์ พร้อมข้อมูลการฝึกหลังการฝึกที่เปิดเผย และไม่มีตัวเลข benchmark ใด ๆ เลย — NVIDIA ชี้ไปที่กราฟความแม่นยำและรายงานทางเทคนิคของ Ultra แทน ลูกค้าของมันคือการรันการกลั่น (distillation runs) ไม่ใช่ปริมาณงานในระบบ production
Qwen3.8 Max เรือธงระดับ Max-class แบบเปิดเป็นรุ่นแรก
การเปิดตัวของ Alibaba มีความสำคัญ เพราะโมเดลระดับ Max-class ของ Qwen ในอดีตนั้นใช้งานได้ผ่าน API เท่านั้น Qwen3.8 Max ทำลายข้อจำกัดนั้น: น้ำหนักของโมเดลสามารถดาวน์โหลดได้ และโมเดลดังกล่าวเป็นโมเดลระดับแนวหน้าอย่างแท้จริง — Artificial Analysis ให้คะแนน Intelligence Index ที่ 58 และ Agentic Index ที่ 58 ซึ่งเท่ากับผู้ให้บริการแบบปิดชั้นนำในงานแบบ agentic จุดเด่นที่ผู้ให้บริการรายงานนั้นแข็งแกร่ง: 93.0 ใน PaperBench (นำหน้า GPT-5.6 Sol และ Fable 5), 92.6 ใน GPQA Diamond, 86.1 ใน OSWorld-Verified จุดอ่อนของมันก็มีอยู่จริงเช่นกัน — 67.7 ใน SWE-bench Pro และ 43.6 ใน Humanity's Last Exam ตามหลังผู้นำ และการทดสอบอิสระพบว่ามีต้นทุนสูงต่องานที่สำเร็จ โดยเฉลี่ย 64 รอบต่องานในการรันแบบ agentic บน API ของ Alibaba มีราคาอยู่ที่ 2.00 ดอลลาร์ต่อล้านโทเคนนำเข้า, 6.00 ดอลลาร์ต่อล้านโทเคนเอาต์พุต และ 0.25 ดอลลาร์ต่อล้านโทเคนอินพุตที่ถูกแคช ซึ่งลดลง 20% จากราคาพรีวิว
โมเดลครู: โครงสร้างพื้นฐานการฝึกอบรมพร้อมด้วยการ์ดโมเดล
NVIDIA-Nemotron-Labs-Teacher-General-Reasoning ไม่ได้แข่งขันในเรื่องตัวเลขเหล่านั้น เพราะมันไม่ได้เผยแพร่ตัวเลขใดๆ สิ่งที่มันนำเสนอแทนคือสถาปัตยกรรมไฮบริด LatentMoE Mamba-2 + Transformer แบบเดียวกับนักเรียน Ultra รองรับบริบทได้สูงสุด 1M โทเคน และมีปุ่มปรับระดับการให้เหตุผล — enable_thinking true/false, โหมด medium_effort, และเพดาน reasoning_budget แบบ hard — ซึ่งไปป์ไลน์การกลั่นจำเป็นต้องใช้เพื่อใช้เหตุผลเชิงลึกกับตัวอย่างยาก และข้ามไปสำหรับตัวอย่างง่าย ฮาร์ดแวร์ขั้นต่ำคือ 4×B200 (หรือ 8×H100) ให้บริการผ่าน vLLM, SGLang, หรือ TensorRT-LLM และ checkpoint มีขนาดดาวน์โหลด 1.12 เทระไบต์ มันไม่ได้ถูกใช้งานโดยผู้ให้บริการ inference รายใด และ NVIDIA ยังไม่ได้ประกาศการโฮสต์ NIM นี่คือการเผยแพร่แบบ weights-only ที่มุ่งเป้าไปที่ห้องปฏิบัติการที่รันฝูง GPU ขนาดใหญ่อยู่แล้ว
สเปก, เคียงข้างกัน
• วัตถุประสงค์ — Teacher: ผู้เชี่ยวชาญด้านการให้เหตุผลระหว่างการฝึกอบรมและผู้ตัดสิน Qwen3.8 Max: เรือธงระดับแนวหน้าพร้อมใช้งาน
• สเกล — Teacher: รวม 550B / ใช้งาน 55B, LatentMoE พร้อม MTP. Qwen3.8 Max: รวม 2.4T / ~95B ใช้งาน, 512 เอ็กซ์เพิร์ต, Qwen3.5 แบบไฮบริด.
• บริบท — Teacher: รองรับสูงสุด 1M โทเค็น, ค่าเริ่มต้น 256K. Qwen3.8 Max: บริบท open-weights ดั้งเดิม 262K, ขยายได้เกิน 1M; เวอร์ชัน API ค่าเริ่มต้น 1M.
• น้ำหนัก — ผู้สอน: OpenMDW-1.1 เผยแพร่เมื่อ 14 ส.ค. 2026. Qwen3.8 Max: Qwen3.8 Max License เผยแพร่เมื่อ ~12 ส.ค. 2026.
• หลักฐานอิสระ — ครู: ยังไม่มี Qwen3.8 Max: AA Intelligence Index 58, Agentic Index 58, Coding Index 71.8.
• การคิด — Teacher: สลับ enable_thinking, medium_effort, เพดาน reasoning_budget. Qwen3.8 Max: บังคับเปิดใน open weights, ไม่สามารถปิดได้
• ราคา — Teacher: ไม่มีราคาประกาศ, capex สำหรับการโฮสต์เอง Qwen3.8 Max: $2.00 / $6.00 ต่อล้านโทเคน, $0.25 สำหรับอินพุตที่แคช


ความไม่สมดุลของหลักฐานคือเรื่องทั้งหมด
Qwen3.8 Max ได้รับการทดสอบแล้ว แต่โมเดลครูยังไม่ได้รับการทดสอบ ส่วนหนึ่งเป็นเพราะอายุ — Qwen3.8 Max เปิดตัวเมื่อวันที่ 3 สิงหาคม และมีการรันบนลีดเดอร์บอร์ดมาเป็นเวลาสองสัปดาห์แล้ว ในขณะที่โมเดลครูเพิ่งเปิดตัวเมื่อวานนี้ — และอีกส่วนหนึ่งเป็นเพราะความตั้งใจ เนื่องจากการ์ดของโมเดลครูไม่เคยถูกสร้างขึ้นมาเพื่อแข่งขันด้านคะแนน แต่ความไม่สมมาตรนี้ส่งผลจริงต่อการเปรียบเทียบ: ตัวเลขที่เป็นรูปธรรมทุกตัวบนหน้านี้ที่มีแหล่งอ้างอิงเป็นของ Qwen3.8 Max และตัวเลขทุกตัวที่อ้างถึงโมเดลครูเป็นสเปกสถาปัตยกรรม คุณภาพการให้เหตุผลของโมเดลครูยังไม่ได้รับการตรวจสอบโดยใครนอกเหนือจาก NVIDIA และตัวเลขระดับตระกูลของมัน (ค่าที่ผู้ผลิตแจ้งสำหรับนักเรียน Ultra: SWE-Bench Verified 71.9, MMLU-Pro 86.8, LiveCodeBench v6 89.0) บรรยายถึงโมเดลที่ต่างออกไป ใครก็ตามที่กำลังตัดสินใจจากคำถามที่ว่า "อันไหนทำคะแนนได้ดีกว่า" ต้องรอการทดสอบอิสระของโมเดลครู ซึ่งเป็นช่องว่างที่สองสามสัปดาห์ข้างหน้าควรจะปิดลง
หน้าปัดที่คิดสองอัน ตั้งค่าแตกต่างกัน
ความแตกต่างทางเทคนิคที่น่าสนใจที่สุดระหว่างสองเวอร์ชันนี้คือสิ่งที่เกิดขึ้นเมื่อคุณขอให้พวกมันใช้เหตุผล Qwen3.8 Max ในรูปแบบ open-weights ไม่มีทางเลือก: การคิดเปิดอยู่เสมอ และ trace การให้เหตุผลเป็นส่วนหนึ่งของทุกคำตอบ ซึ่งดีต่อคุณภาพและความโปร่งใสของคำตอบ แต่มีค่าใช้จ่ายสูงสำหรับการสร้างจำนวนมาก โมเดลครูปฏิบัติต่อการให้เหตุผลเหมือนปุ่มปรับ: enable_thinking สลับมัน, medium_effort จำกัดความเร็ว และ reasoning_budget เป็นเพดานที่จำกัดมัน สำหรับไปป์ไลน์การกลั่น ความแตกต่างนี้ชี้ขาด — การสร้าง trace การให้เหตุผลหลายล้านรายการด้วยโมเดลที่คิดตลอดเวลาจะทำให้ค่าใช้จ่ายโทเคนของคุณทวีคูณ ในขณะที่สวิตช์ของโมเดลครูช่วยให้คุณจ่ายสำหรับการคิดเชิงลึกเฉพาะเมื่อตัวอย่างที่ยากต้องการมันเท่านั้น สิ่งเหล่านี้ไม่ใช่ปรัชญาการออกแบบที่แข่งขันกัน แต่เป็นเครื่องมือสองอย่างที่ปรับให้เหมาะกับปลายทางที่ตรงกันข้ามของปัญหาเดียวกัน และแต่ละอย่างคือเครื่องมือที่เหมาะสมสำหรับปลายทางของมัน

สรุป
หากคุณต้องการรันโมเดลระดับแนวหน้าบนฮาร์ดแวร์ของคุณเอง — หรือเรียกใช้ที่ราคาสมเหตุสมผล — Qwen3.8 Max คือรุ่นที่สำคัญ และมันอยู่บน OrcaRouter ในราคารายการของ Alibaba ส่งผ่านโดยไม่บวกเพิ่ม 0% ดังนั้นการลดราคาที่ Alibaba ประกาศตอนเปิดตัวจึงมีผลบนฝั่งของเราในวันเดียวกัน หากคุณต้องการเทรนหรือดิสทิลโมเดลให้เหตุผล — หรือตรวจสอบสัญญาณที่หล่อหลอม Nemotron 3 Ultra — NVIDIA-Nemotron-Labs-Teacher-General-Reasoning คือรุ่นที่สำคัญ และในตอนนี้รองรับเฉพาะการโฮสต์เองเท่านั้น เรื่องที่ใหญ่กว่าคือทั้งคู่เปิดตัวในสัปดาห์เดียวกัน: โมเดลโอเพนเวตเพิ่งเปลี่ยนจาก "เปิดพอที่จะดูได้" ไปเป็น "เปิดพอที่จะสร้างต่อได้" ณ จุดสองจุดที่แตกต่างกันในห่วงโซ่อุปทานของโมเดล ทีมที่ทำให้ชั้นโมเดลของตนสลับเปลี่ยนได้ภายใต้อินเทอร์เฟซเดียว — การเทรนแบบโฮสต์เองในด้านหนึ่ง การอินเฟอเรนซ์ระดับแนวหน้าแบบบริการจัดการในอีกด้านหนึ่ง — คือทีมที่อยู่ในจุดที่พร้อมใช้ทั้งสองอย่าง
การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
