
Nemotron-3-Labs-Ultra-Math-RL: NVIDIA เปิดโอเพนซอร์สเช็คพอยต์ RL ที่อยู่เบื้องหลังการลงแข่ง IMO 2026 อย่างเงียบ ๆ
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0455ความฉลาด77การเขียนโค้ด
- googleใหม่Google: Gemini 3.8 Flash2026-09-0247ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0247ความฉลาด72การเขียนโค้ด
- anthropicใหม่Anthropic: Claude Fable 5.12026-09-0157ความฉลาด82การเขียนโค้ด
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2646ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1849ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1541ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1251ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0547ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0347ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2140ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128ความฉลาด49การเขียนโค้ด
NVIDIA dropped Nemotron-3-Labs-Ultra-Math-RL on Hugging Face on September 2–3, 2026, with no blog post, no X announcement and no press release — the model card simply appears, dated September 3, and explains itself in one line: it is the reinforcement-learning checkpoint, referred to as "Nemotron-3-Ultra-RL" in NVIDIA's accompanying technical report, that was "deployed as part of an ensemble system that achieved a gold-medal level score at the International Mathematical Olympiad 2026." That system's official score — 30 out of 42 points, above the 29-point gold threshold — was widely reported back in late July, when the base model's weights had been public since June. What was not downloadable then was the pair of post-trained specialists the competition run actually used. One of them is now sitting in a public Hugging Face repo with zero likes and a near-zero download count.
นี่เป็นเรื่องของการเผยแพร่แบบเงียบ ๆ ดังนั้นจึงควรระมัดระวังในการแยกแยะว่าสิ่งใดที่สามารถรู้ได้และสิ่งใดที่ยังไม่สามารถรู้ได้ สิ่งที่รู้ได้จาก repository และรายงาน: สถาปัตยกรรมของ checkpoint สูตรการฝึก บทบาทที่มันมีในการส่งผลงาน IMO 2026 รวมถึงชุดข้อมูลและ benchmark ที่ NVIDIA ปล่อยออกมาพร้อมกัน ยังไม่ได้รับการยืนยัน: การประกาศจากผู้ขายรายใด การวัดประสิทธิภาพโดยบุคคลที่สามอย่างอิสระต่อ checkpoint นี้ และ hosted API ใด ๆ — นี่คือการปล่อยน้ำหนักโมเดลแบบ self-host ภายใต้สัญญาอนุญาต OpenMDW-1.1 และการรันมันหมายถึงการต้องตั้งค่าระบบ HBM ระดับ Blackwell ขนาดประมาณ 1.5 TB
สิ่งที่เปิดตัวจริงในสัปดาห์นี้
รีโพซิทอรี nvidia/Nemotron-3-Labs-Ultra-Math-RL ถูกสร้างขึ้นบน Hugging Face เมื่อวันที่ 2 กันยายน 2026 (เวลา 19:11 UTC) และแก้ไขล่าสุดเมื่อวันที่ 8 กันยายน เป็นหนึ่งในรายการของการเผยแพร่ที่ประสานงานกันซึ่งรวบรวมไว้ภายใต้ nvidia/nemotron-labs-imo-2026 ซึ่งประกอบด้วย:
• จุดตรวจสอบการแข่งขันสองจุดที่ผ่านการฝึกขั้นหลัง — Nemotron-3-Labs-Ultra-Math-RL (หัวข้อนี้) และรุ่นพี่น้องของมันที่ผ่านการปรับแต่งแบบมีผู้ดูแล Nemotron-3-Labs-Ultra-Math-SFT ซึ่งทั้งคู่อยู่ภายใต้ OpenMDW-1.1
• เบื้องหลังคือชุดข้อมูลฝึกอบรมสองชุด ได้แก่ Nemotron-Math-Proofs-v3-SFT และ Nemotron-Math-Proofs-v3-RL ซึ่งทั้งคู่อยู่ภายใต้ใบอนุญาต CC-BY-4.0
• Nemotron-IMO-Bench เกณฑ์ชี้วัดการประเมินชุดใหม่ที่มีโจทย์ระดับโอลิมเปียดที่ยังไม่เผยแพร่จำนวน 200 ข้อ (พีชคณิต 50 ข้อ คณิตศาสตร์เชิงการจัด 50 ข้อ เรขาคณิต 50 ข้อ ทฤษฎีจำนวน 50 ข้อ) โดยแต่ละข้อมีบทพิสูจน์อ้างอิงที่คัดสรรโดยมนุษย์ ถูกสร้างขึ้นร่วมกับนักคณิตศาสตร์ Titu Andreescu เพื่อให้โจทย์เหล่านี้ไม่สามารถปรากฏในชุดข้อมูลฝึกใดๆ ได้
• เช็คพอยต์พื้นฐาน NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16 ซึ่งโมเดลทั้งหมดถูกฟินจูนมาจากเช็คพอยต์นี้
คำอธิบายของคอลเลกชันชี้ไปที่รายงานทางเทคนิคที่เชื่อมโยงทุกอย่างเข้าด้วยกัน: "An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics" (ไฟล์ PDF ในที่เก็บ NeMo-Skills ของ NVIDIA ลงวันที่ 8 กันยายน 2026) ควบคู่ไปกับเช็คพอยต์ NVIDIA ยังได้เผยแพร่ไปป์ไลน์การอนุมาน บทพิสูจน์ที่ส่งเข้าแข่งขัน สูตรการฝึกแบบ RL และการแจกแจงการใช้ทรัพยากรการประมวลผลทั้งหมดของการแข่งขันครั้งนั้นด้วย กรอบการนำเสนอนี้เป็นแนวทางวิทยาศาสตร์ที่ทำซ้ำได้อย่างชัดเจน นั่นคือ NVIDIA กำลังประกาศว่านี่คือทุกสิ่งที่จำเป็นต้องใช้ในการสร้างระบบนี้ขึ้นมาใหม่
Nemotron-3-Labs-Ultra-Math-RL คืออะไร
ในเชิงสถาปัตยกรรม นี่ไม่ใช่เบสโมเดลใหม่ — แต่เป็นการฟายจูนของโมเดลที่เปิดให้ใช้งานทั่วไป NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16 ซึ่งเป็นเช็คพอยต์ Mamba2–Transformer hybrid Latent Mixture-of-Experts ที่ NVIDIA เปิดตัวครั้งแรกเมื่อวันที่ 4 มิถุนายน 2026 เช็คพอยต์ Math-RL ยังคงสถาปัตยกรรมและขนาดเดียวกัน: พารามิเตอร์รวม 550B โดยมีพารามิเตอร์ที่ทำงานจริง 55B, รองรับการทำนายหลายโทเค็น (multi-token prediction), และรองรับคอนเทกซ์วินโดว์ได้สูงสุดถึง 1M โทเค็น สิ่งที่การฝึกแบบ RL เปลี่ยนไปคือความเชี่ยวชาญเฉพาะด้าน และมันถูกออกแบบให้แคบลงอย่างจงใจ:
• วัตถุประสงค์ — แก้โจทย์คณิตศาสตร์ระดับแข่งขันที่ยาก และทำหน้าที่เป็นผู้ตรวจพิสูจน์: โมเดลถูกฝึกให้สร้างวิธีทำที่รัดกุม ประเมินตนเองด้วยเกณฑ์การให้คะแนน 0 / 0.5 / 1 และระบุข้อผิดพลาดในบทพิสูจน์
มันไม่ใช่แชทบอตทั่วไป — การ์ดและรายงานอธิบายถึงผู้ปฏิบัติงานเฉพาะทางสำหรับไปป์ไลน์การค้นหาบทพิสูจน์ ไม่ใช่ผู้ช่วยที่ทำตามคำสั่ง
• ใบอนุญาต — OpenMDW-1.1 ใบอนุญาตโอเพนโมเดลแบบผ่อนปรนของ NVIDIA ที่อนุญาตให้ใช้ทั้งในเชิงพาณิชย์และไม่ใช่เชิงพาณิชย์ เช่นเดียวกับโมเดลฐานและรุ่นครู (teacher releases) ก่อนหน้าของ Nemotron Labs
การปรับใช้ — ไม่มีราคาพื้นฐานสำหรับบริการโฮสต์ที่ใด คุณดาวน์โหลด safetensors แล้วโฮสต์เอง คอนฟิกอ้างอิงของ NVIDIA คือโหนดเดียวที่มี 8× B200 (หน่วยความจำ HBM รวม ~1.5 TB) พร้อมตัวเลือกหลายโหนดบน H100/H200/GB200/GB300 vLLM เป็นรันไทม์ที่แนะนำ พร้อมตัวแยกวิเคราะห์เชิงเหตุผล ตัวแยกวิเคราะห์การเรียกเครื่องมือ Qwen3-Coder การตั้งค่าแคช Mamba SSM และการถอดรหัสแบบคาดเดา MTP บน 5 โทเค็น ซึ่งทั้งหมดระบุไว้ในการ์ด

เหตุใดเช็คพอยต์นี้จึงสำคัญ: มันอยู่ภายในระบบ IMO 2026
ผลลัพธ์ IMO 2026 คือเหตุผลที่ผู้คนต่างจับตามองโมเดลนี้ ดังนั้นข้อแตกต่างที่สำคัญคือ: 30/42 ที่ว่านี้เป็นคะแนนของระบบ ไม่ใช่คะแนนของโมเดลตัวเดียว ผลงานที่ NVIDIA ส่งเข้าประกวดเป็นไปป์ไลน์แบบสองขั้นตอนที่มีหลายเช็คพอยต์ และ Nemotron-3-Labs-Ultra-Math-RL เป็นองค์ประกอบที่มีหน้าที่สองอย่างในนั้น
ตามรายงาน ขั้นตอนแรกดำเนินการค้นหาแบบวนซ้ำ (generate–verify–refine) มากถึงแปดรอบต่อหนึ่งปัญหา รอบแรกสุ่มตัวอย่างความพยายามพิสูจน์ 384 ครั้ง โดยจุดตรวจสอบทั้งสามจุด ได้แก่ โมเดลที่พร้อมใช้งานทั่วไป ผู้เชี่ยวชาญ SFT และผู้เชี่ยวชาญ RL ต่างให้ 16 ครั้งจากพรอมต์กลยุทธ์การแก้ปัญหาแต่ละแบบในแปดแบบ การตรวจสอบระหว่างการค้นหาใช้จุดตรวจสอบ RL และ SFT เป็นผู้ตัดสินร่วมสองโมเดล กล่าวคือแต่ละโมเดลให้การตัดสินอิสระแปดครั้ง และการพิสูจน์จะยอมรับได้ก็ต่อเมื่อการตัดสินทั้ง 16 ครั้งให้คะแนนเป็น 1 ทั้งหมด ในขั้นตอนที่ใช้การคำนวณสูงในภายหลัง ผู้เข้าชิงทุกคนถูกให้คะแนนใหม่ด้วยจุดตรวจสอบทั้งสามจุด (จุดตรวจสอบละ 16 การตัดสินแบบ IMO บนมาตราส่วน 0–7) และเลือกผลงานส่งหนึ่งชิ้นสำหรับแต่ละปัญหา
ผลลัพธ์อย่างเป็นทางการ ตามที่รายงานในเอกสารฉบับดังกล่าวและสอดคล้องกับรายงานช่วงปลายเดือนกรกฎาคม: ได้ 30 จาก 42 คะแนนบนข้อสอบ IMO 2026 สูงกว่าเกณฑ์เหรียญทองที่ 29 คะแนน โดยได้คะแนนเต็มในโจทย์ข้อ 1, 2, 4 และ 5 และได้ข้อละ 1 คะแนนในโจทย์ข้อ 3 และ 6 ตรวจให้คะแนนโดยกรรมการตรวจข้อสอบ IMO อย่างเป็นทางการ การคิดต้นทุนทรัพยากรของ NVIDIA เองระบุว่าบทพิสูจน์ทั้งหกฉบับที่ส่งเข้าประกวดถูกค้นพบภายในโทเค็นที่สร้างขึ้นประมาณ 707M และเวลาใช้งาน GPU GB200 รวมประมาณ 1,464 ชั่วโมง การทำรอบที่กำลังดำเนินอยู่ให้เสร็จสิ้นทำให้การรันทั้งหมดใช้โทเค็นประมาณ 2.31B และเวลาใช้งาน GPU GB200 4,800 ชั่วโมง
ตัวเลขภายในสองชุดจากรายงานทำให้เข้าใจว่าเหตุใด RL checkpoint จึงได้ตำแหน่งในกลุ่มโมเดลทั้งหมด ในการทดสอบชุดพัฒนาคำตอบ 30 ข้อของ NVIDIA ซึ่งให้คะแนนโดยคณะกรรมการอิสระจาก GPT-5.5, Gemini 3.1 Pro และ Claude Opus 4.8 ตามกระบวนการแบบ MathArena นั้น ผู้เชี่ยวชาญ RL เป็นไปป์ไลน์แบบ checkpoint เดียวที่ดีที่สุดตั้งแต่ต้นจนจบ (ได้ 180 จากคะแนนคณะกรรมการทั้งหมด 210 คะแนน เทียบกับ 165 ของผู้เชี่ยวชาญ SFT และ 162 ของโมเดลฐาน) ถึงแม้ว่า SFT checkpoint จะแก้โจทย์ได้มากกว่าในรอบแรกก็ตาม และในชุดตรวจสอบที่มี 300 บทพิสูจน์ แผงตรวจสอบ RL+SFT ที่ใช้งานจริงช่วยลดอัตราการยอมรับผิด ซึ่งเป็นความล้มเหลวที่ทำให้การค้นหาจบลงที่บทพิสูจน์ที่ไม่ถูกต้อง ให้เหลือประมาณ 1.1% เทียบกับ 12.4% เมื่อให้ RL checkpoint ตัดสินเพียงลำพัง และ 31.6% สำหรับโมเดลฐาน ประเด็นของรายงานคือ ผู้เชี่ยวชาญเฉพาะทางสองตัวนี้จะจับข้อผิดพลาดของกันและกันภายใต้กฎเอกฉันท์
สิ่งเหล่านี้คือผลการทดสอบแบบ ablation บนชุดพัฒนาของ NVIDIA ที่ NVIDIA เองเป็นผู้ดำเนินการและรายงานไว้ในบทความวิจัยของ NVIDIA โดยควรถือเป็นหลักฐานที่ผู้ผลิตเองรายงานว่า เหตุใดการออกแบบจึงทำงานได้ ไม่ใช่คะแนนจากการประเมินแบบอิสระ ชุดพัฒนานี้มีโจทย์เพียง 30 ข้อเท่านั้น และยังไม่มีห้องปฏิบัติการภายนอกแห่งใดนำ checkpoint นี้ไปทดสอบเลย
สูตร RL โดยย่อ
ข้อมูลการฝึกและวิธีการถูกเปิดเผยทั้งหมด ซึ่งถือเป็นข่าวสำคัญสำหรับผู้ที่ทำงานวิจัย RL ด้านการให้เหตุผลทางคณิตศาสตร์ ประเด็นสำคัญจากรายงาน:
• ข้อมูล — ปัญหาถูกดึงมาจากชุดย่อย AoPS ของ Nemotron-Math-Proofs-v1 โดยกรองเฉพาะปัญหาที่โมเดล Ultra ฐานแก้ได้หนึ่งถึงสามครั้งจากการลองสี่ครั้ง (ประเมินโดย DeepSeek-V3.2-Speciale) ซึ่งเป็นปัญหาหลักสูตรที่ยากแต่พอจะจัดการได้ ผลลัพธ์จากการกรองให้พรอมต์สำหรับสร้างบทพิสูจน์จำนวน 9,597 รายการ เผยแพร่ในชื่อ Nemotron-Math-Proofs-v3-RL
• รางวัล — เป็นไปตามการออกแบบ DeepSeekMath-V2 แต่ไม่รวมเงื่อนไขรางวัลการวิเคราะห์ตนเอง สัญญาณผู้ตัดสินมาจากบริการผู้ตัดสินการพิสูจน์ในระหว่างการฝึก
• อัลกอริทึม — RL แบบอะซิงโครนัสที่สร้างบน NeMo-RL มีแนวคิดใกล้เคียงกับ PipelineRL กล่าวคือ มีพูลพรอมป์ตายตัวที่ถูกเก็บให้อยู่ในระหว่างการประมวลผลตลอดเวลา ซีเควนซ์ที่เสร็จสมบูรณ์จะถูกส่งให้เทรนเนอร์เมื่อเต็มแบทช์ ใช้การสุ่มตัวอย่างแบบ truncated importance sampling และเมื่อเอนโทรปีสูงขึ้น จะมาสก์โทเคนที่มีความน่าจะเป็นต่ำบนตัวอย่างเชิงบวก โดยคอนฟิกดังกล่าวใช้คอนเทกซ์ขนาด 131,072 โทเคน และมีเทรนเนอร์โหนดประมาณ 128 โหนด อินเฟอเรนซ์โหนด 128 โหนด และจั๊ดจ์โหนด 16 โหนด ซึ่งแต่ละโหนดมี 4× GB200
เพื่อการเปรียบเทียบ เช็คพอยต์ SFT คู่ขนานนั้นเป็นการปรับเทียบแบบมีผู้ดูแลสำหรับบริบทระยะยาวจากโมเดลฐานเดียวกัน บนคลังข้อมูลที่ผ่านการคัดกรองคุณภาพ ซึ่งประกอบด้วยร่องรอยการพิสูจน์ การปรับปรุง การตรวจสอบ และการตรวจสอบเชิงอภิระดับ 414,890 รายการ ครอบคลุมโจทย์ 15,818 ข้อ โดยดำเนินการบนจีพียู GB200 จำนวน 512 ตัว

สิ่งที่ยังไม่ทราบ
การอ้างอิงแหล่งข่าวอย่างตรงไปตรงมานั้นมีผลทั้งสองทาง และผู้อ่านที่กำลังตัดสินใจว่าจะให้ความสนใจกับการเผยแพร่นี้หรือไม่ ควรคำนึงถึงข้อควรระวังสี่ประการ:
• ไม่มีการประกาศ ในขณะที่เขียนบทความนี้ NVIDIA ยังไม่ได้ประกาศคอลเลกชันดังกล่าวอย่างเป็นทางการ โดยคอลเลกชันเพิ่งปรากฏบน Hugging Face รายงานเทคนิคฉบับ PDF ลงวันที่ 8 กันยายน ดังนั้นสูตรฉบับเขียนจึงถือว่าเผยแพร่ในสัปดาห์นี้เช่นกัน
• ไม่มีการทดสอบมาตรฐานโดยอิสระ ตัวเลขประสิทธิภาพทุกค่าที่แนบมากับ checkpoint นี้ ไม่ว่าจะเป็นการทำ ablation บน dev-set การตรวจสอบโดย verifier หรือคะแนนระบบ IMO 2026 ล้วนมาจากรายงานของ NVIDIA เอง คะแนน IMO เองมีที่มาน่าเชื่อถือที่สุดในกลุ่มนี้ เพราะถูกตรวจให้คะแนนภายใต้เงื่อนไขการแข่งขันอย่างเป็นทางการ แต่มันเป็นผลลัพธ์ระดับระบบ และการมีส่วนร่วมของ checkpoint ต่อผลลัพธ์นี้ยังไม่มีห้องปฏิบัติการภายนอกแห่งใดทำซ้ำได้
• ไม่มี hosted API และไม่มีราคาที่ประกาศ นี่คือเวอร์ชัน self-host ใครก็ตามที่ต้องการจะ เรียกใช้ มันจำเป็นต้องมีฮาร์ดแวร์ รายงานข่าวจากเดือนกรกฎาคมที่ว่า “NVIDIA Nemotron 3 Ultra คว้าเหรียญทองใน IMO 2026” อาจถูกตีความได้ง่ายว่า “ดาวน์โหลดสิ่งนี้แล้วมันจะแก้โจทย์โอลิมปิกได้” — แต่ความจริงคือ “ดาวน์โหลดส่วนประกอบของระบบที่ทำได้จริง”
• การตีกรอบว่าเป็นเหรียญทอง.ถ้อยคำของ NVIDIA เองคือ "ถึงเกณฑ์ระดับเหรียญทอง" และในเอกสารก็ระมัดระวังที่จะระบุว่าโมเดลนี้เป็นส่วนหนึ่งของเอนเซมเบิล ให้ถือว่าข้อกล่าวอ้างใดๆ ที่ว่า checkpoint เพียงจุดเดียวนี้อยู่ในระดับ "เหรียญทอง" นั้นไม่มีหลักฐานสนับสนุน.
สิ่งนี้เหมาะสำหรับใคร
รีลีสนี้มุ่งเป้าไปที่ผู้อ่านกลุ่มเฉพาะ: นักวิจัยในห้องแล็บที่ทำงานด้านการให้เหตุผลทางคณิตศาสตร์ การสร้างบทพิสูจน์ หรือ RL พร้อมรางวัลที่ตรวจสอบได้ ซึ่งต้องการ implementation อ้างอิงของระบบที่ผ่านเกณฑ์ระดับเหรียญทองโอลิมปิกในภาษาธรรมชาติ — ไม่ต้องใช้ formal prover ไม่ต้องใช้เครื่องมือ ไม่ต้องใช้อินเทอร์เน็ต สำหรับผู้อ่านกลุ่มนั้น คุณค่าอยู่ที่แพ็คเกจทั้งหมด: น้ำหนักโมเดล corpora สำหรับ SFT และ RL พรอมป์ต์ที่จัดรูปแบบตาม NeMo-Gym ไปป์ไลน์การอนุมาน บทพิสูจน์ที่ส่งเข้ารอบ และการคิดบัญชีการคำนวณที่ระบุว่าการรันการแข่งขันหนึ่งครั้งต้องใช้ GPU-hour จริงเท่าใด
สำหรับคนอื่นๆ ข้อสังเกตในทางปฏิบัติก็คือ การค้นหาบทพิสูจน์ระดับโอลิมปิกนั้นเกินความจำเป็นสำหรับงานคณิตศาสตร์จริงส่วนใหญ่ โจทย์ระดับ AIME และระดับแข่งขัน รวมถึงงานคณิตศาสตร์ประยุกต์ในโค้ดแทบทั้งหมด จัดการได้อย่างสบายๆ ด้วยโมเดลที่เล็กกว่ามาก — ซึ่งเป็นเรื่องสำคัญ เพราะเช็คพอยต์ขนาด 550B ไม่ใช่สิ่งที่คุณจะสปินขึ้นมาเพื่องานแบตช์ โมเดลคณิตศาสตร์โอเพนซอร์สขนาดเล็กและโมเดล API ระดับแนวหน้าเข้าถึงได้ผ่าน API เดียวบน OrcaRouter ในราคารายการของผู้ให้บริการ (เราไม่บวกกำไร ดังนั้นการลดราคาจากผู้ขายจึงมีผลทันทีในวันเดียวกัน) พร้อมการเฟลโอเวอร์อัตโนมัติ หากคุณต้องการลองโมเดลที่ยังไม่ผ่านการพิสูจน์โดยไม่ต้องเสี่ยงกับเส้นทางโปรดักชันของคุณ เริ่มจากตรงนั้น แล้วค่อยไปโฮสต์เองกับโมเดล 550B เฉพาะเมื่องานต้องการการค้นหาบทพิสูจน์ระดับแนวหน้าจริงๆ เท่านั้น
คำถามเปิดที่ต้องจับตาคือ การปล่อยลงอย่างเงียบ ๆ ครั้งนี้จะมีการประกาศอย่างเป็นทางการและมีบันทึกการเปลี่ยนแปลง (release note) อย่างเป็นทางการตามมาหรือไม่ และจะมีใครนอกเหนือจาก NVIDIA ที่นำกระบวนการ (recipe) ไปรันแบบ end-to-end แล้วรายงานคะแนน IMO-Bench อย่างอิสระหรือไม่ เกณฑ์วัดดังกล่าว — โจทย์โอลิมปิกชุดใหม่ที่ยังไม่เคยถูกเผยแพร่ 200 ข้อ — นับเป็นสิ่งประดิษฐ์ที่มีประโยชน์ที่สุดในคอลเลกชันนี้ เพราะมันคือการประเมินแบบต้านทานการปนเปื้อน (contamination-resistant) ที่วงการนี้ขาดหายไปจริง ๆ หากกระบวนการนี้สามารถทำซ้ำได้ (reproduce) การอัปโหลดอย่างเงียบ ๆ บน Hugging Face ในสัปดาห์นี้จะกลายเป็นหนึ่งในการปล่อยโมเดลโอเพนที่มีความสำคัญที่สุดของปี และหากทำไม่ได้ คอลเลกชันนี้ก็ยังคงเป็นบันทึกที่ละเอียดและตรงไปตรงมาว่าการรัน generate–verify–refine ในระดับ frontier-scale หนึ่งครั้งนั้นต้องใช้อะไรจริงบ้าง

การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
