
MiMo-V2.6: สิ่งที่เปเปอร์ RL ของ Xiaomi แสดงให้เห็นจริง ๆ และสิ่งที่ยังคงไม่ได้รับการยืนยัน
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 36 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 182 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
บทความโมเดลส่วนใหญ่ที่เผยแพร่ในเดือนนี้เป็นบทความเกี่ยวกับสถาปัตยกรรม รายงานทางเทคนิคเบื้องหลัง Xiaomi MiMo-V2.6-Pro และ Xiaomi MiMo-V2.6-Flash ไม่ใช่เช่นนั้น โดยมีชื่อว่า MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement ส่งเมื่อวันที่ 21 กันยายน 2026 และระบุว่าอยู่ในความรับผิดชอบของ LLM-Core Xiaomi เนื้อหาแทบไม่มีส่วนใดกล่าวถึงโครงข่ายหลักแบบ sparse mixture-of-experts เลย และเกือบทั้งหมดทุ่มให้กับคำถามข้อเดียวว่า จะเกิดอะไรขึ้นเมื่องบประมาณการฝึกหลังการฝึก (post-training) ทั้งหมดถูกใช้ไปกับการรัน reinforcement learning แบบผสมเพียงครั้งเดียว ในทางตรงกันข้าม รายงานของ DeepSeek-V4.1-Flash เป็นเอกสารว่าด้วยหน่วยความจำ ความยาวของมันทุ่มให้กับ compressed sparse attention, การใช้ KV ซ้ำข้ามเลเยอร์ และการจัดเก็บแบบ FP4 เมื่อวางสองชิ้นนี้เทียบกัน มันคือข้อโต้แย้งเกี่ยวกับว่าความสามารถนั้นมาจากไหน และทั้งสองไม่เห็นตรงกัน
รายงานนี้ควรค่าแก่การอ่านในแง่ของตัวมันเอง แต่ควรอ่านอย่างระมัดระวัง เพราะมันเป็นรายงานตนเองจากห้องแล็บที่รันการทดลองนั้น มันระบุชื่อกลไกของมัน แสดงการทดลองแบบ ablation เผยแพร่ความล้มเหลวของมัน และในขณะเดียวกันก็รายงานตัวเลขที่ไม่สามารถตรวจสอบจากภายนอกได้ การแยกสองสิ่งนี้ออกจากกันคือส่วนสำคัญที่สุดของงาน ชิ้นนี้ทำเช่นนั้น และเขียนขึ้นเมื่อวันที่ 23 กันยายน 2026 — สองวันหลังจากเช็กพอยต์ถูกอัปโหลดขึ้นไป ขณะที่บทความนี้เป็นสิ่งใหม่ที่สุดและได้รับการยืนยันประกอบน้อยที่สุดเกี่ยวกับเช็กพอยต์เหล่านั้น
ทำไมวันที่บนกระดาษจึงสำคัญกว่าปกติ
เช็กพอยต์ MiMo-V2.6-Pro และ MiMo-V2.6-Flash ของ Xiaomi ถูกปล่อยบนโมเดลฮับเมื่อวันที่ 21 กันยายน 2026 ภายใต้สัญญาอนุญาต MIT และไม่มีการจำกัดการเข้าถึง รายงานฉบับนี้ลงวันที่วันเดียวกัน และติดอันดับต้น ๆ ของรายการเทรนดิงบนเว็บไซต์ preprint ที่เผยแพร่ จังหวะเวลานี้คือเหตุผลที่ชิ้นนี้เป็นข่าวมากกว่าจะเป็นบทความย้อนหลัง: งานวิจัยนี้ไม่ใช่คำอธิบายที่ตามมาทีหลังของโมเดลที่ทุกคนวัดประสิทธิภาพกันไปแล้ว หากแต่มาพร้อมกับเวตของโมเดล ก่อนที่任何人ภายนอก Xiaomi จะเผยแพร่การทดสอบที่เป็นอิสระ

การจัดเรียงนั้นก็เป็นจุดอ่อนหลักของงานวิจัยนี้ในฐานะหลักฐานเช่นกัน ทุกสิ่งที่เป็นผลสืบเนื่องมาจากมัน — เส้นโค้ง DeepSWE, การเพิ่มขึ้นของอัตราการผ่าน, การป้องกันการแฮ็กผลตอบแทน — เป็นข้อกล่าวอ้างเกี่ยวกับกระบวนการฝึกที่เกิดขึ้นครั้งเดียว ในห้องแล็บเดียว บนคลัสเตอร์เดียว และไม่มีใครอื่นทำซ้ำได้ กระทู้ที่ตั้งข้อสังเกตเกี่ยวกับรายงานนี้มองว่านั่นเป็นส่วนที่น่าสนใจ: นี่เป็นงานวิจัยด้านข้อมูลและการทดลอง ไม่ใช่งานวิจัยด้านสถาปัตยกรรม และการทดลองก็เป็นผลลัพธ์ประเภทที่ทำซ้ำได้หรือไม่ได้เท่านั้น
สามแกนของการขยายระบบ และมีเพียงหนึ่งในนั้นที่เป็นปัญหาฮาร์ดแวร์
การวางกรอบของรายงานก็คือ การประมวลผลสำหรับการเรียนรู้แบบเสริมกำลังถูกขยายไปพร้อมกันในสามแกน และแกนที่สามคือแกนที่เปลี่ยนวิธีที่คุณคิดเกี่ยวกับวิธีการนี้
• แบตช์และอัตราการประมวลผล — 1,568 ตัวอย่างต่อการอัปเดต โดยแต่ละตัวอย่างขยายเป็น 16 โรลเอาต์ ดังนั้นจึงมีวิถีประมาณ 25,000 วิถีต่อขั้นตอน ซึ่งใช้โทเคน 2.7 ถึง 3.7 พันล้านโทเคนต่อขั้นตอน ที่ความยาวคอนเท็กซ์สูงสุดถึงหนึ่งล้านโทเคน สถาปัตยกรรมโรลเอาต์เป็นแบบอะซิงโครนัสเต็มรูปแบบ ซึ่งเป็นสิ่งที่ทำให้ขนาดแบตช์นั้นพอจะอยู่รอดได้เลย
• สภาพแวดล้อม — การรันแบบผสมผสานเดียวข้ามงานด้านโค้ด, เอเจนต์ทั่วไป, งานภาพและไซเบอร์ ภายใต้ฮาร์เนสของเอเจนต์หลายตัวพร้อมกัน แทนที่จะเป็นการรัน RL แยกตามโดเมน ชื่อย่อของ Xiaomi เองสำหรับสิ่งนี้คือ "You Only RL Once" ข้อโต้แย้งสำหรับการผสมผสานคือความก้าวหน้าในความสามารถหนึ่งจะเสริมความสามารถอื่นๆ; ความเสี่ยงคือประเภทงานที่ช้ากว่าจะขาดแคลน ซึ่งรายงานกล่าวว่าจัดการได้ด้วยการจัดตารางแบบปรับตัว
• Grader compute — แกนที่ไม่ได้เกี่ยวกับ GPU ในความหมายปกติ การผ่าน/ไม่ผ่านแบบทวิภาคไม่สามารถจัดอันดับสองวิธีแก้ไขที่ผ่านทั้งคู่ได้ ดังนั้นสัญญาณรางวัลเองจึงกลายเป็นสิ่งที่คุณต้องขยาย ตัวให้คะแนนแบบเอเจนติกจะเปรียบเทียบความพยายามสิบหกครั้งสำหรับงานหนึ่งพร้อมกัน และสร้างสัญญาณแบบมีระดับแทนที่จะเป็นบิต
แกนที่สามคือจุดที่วลี “self-improvement” ในชื่อเรื่องได้ที่ยืนของมัน และเป็นจุดที่รายงานเปราะบางที่สุด การที่โมเดลให้คะแนนโรลเอาต์ของตัวเองถือเป็นพื้นผิวสำหรับ reward hacking และรายงานก็ปฏิบัติต่อมันเช่นนั้น
สองกลไกที่ควรค่าแก่การทำความเข้าใจจริง ๆ
การกระจายข้อได้เปรียบแบบกลุ่ม
หลังจากแต่ละขั้นตอน นโยบายจะสร้างความพยายามสิบหกครั้งต่อหนึ่งงาน และทั้งหมดจะถูกวางไว้ในพื้นที่ทำงานร่วมกัน เพื่อให้โมเดลผู้ประเมินสามารถตรวจสอบพร้อมกันได้แทนที่จะตรวจทีละรายการ จากนั้นแพตช์ที่ผ่านจะถูกให้คะแนนในห้ามิติ ได้แก่ แนวทางเหมาะสมกับปัญหาหรือไม่ การนำไปใช้แม่นยำโดยไม่มีกลไกสำรองที่ไม่จำเป็นหรือไม่ การเปลี่ยนแปลงน้อยที่สุดหรือไม่ มีการแก้ไขสิ่งใดนอกขอบเขตหรือไม่ และสอดคล้องกับสไตล์โค้ดโดยรอบหรือไม่ แพตช์ที่ผ่านซึ่งมีอันดับต่ำกว่าจะได้รับการเสริมแรงเชิงบวกน้อยลง แพตช์ที่ยืนยันว่าเป็นแฮ็กจะถูกรีเซ็ตเป็นศูนย์และถือว่าเป็นความล้มเหลว
ผลลัพธ์ก็คือสัญญาณการฝึกที่ผลักดันไปสู่แนวทางแก้ปัญหาที่สั้นลงและมีต้นทุนต่ำลง แทนที่จะเป็นเพียงแนวทางที่ถูกต้องเท่านั้น — รายงานอธิบายสิ่งนี้ว่าเป็นการชี้นำไปสู่การใช้โทเคนต่องานให้น้อยลง นั่นคือส่วนที่ควรจับไว้ให้มั่น เพราะผลลัพธ์หลักในช่วงหลังของบทความชี้ไปในทิศทางตรงกันข้าม
การสังเคราะห์รางวัลแบบรายกลุ่ม
อีกครึ่งหนึ่งแบบออฟไลน์ของแนวคิดเดียวกัน แทนที่จะได้คุณภาพมาจากตัวให้คะแนนแบบสดเพียงอย่างเดียว ทีมจะคำนวณรูบริกเฉพาะงานไว้ล่วงหน้า และคูณรางวัลจากการทดสอบแบบไบนารีด้วยคะแนนคุณภาพและคะแนนพฤติกรรมที่ดึงมาจากรูบริกเหล่านั้น รายงานอธิบายสิ่งนี้ว่าเป็นการสร้างรูบริกจากการโรลเอาต์ที่แตกต่างกัน กล่าวคือ จากกรณีที่ผลลัพธ์แตกต่างกัน ซึ่งเป็นจุดที่มีข้อมูลอยู่
การให้คะแนนไม่ได้มาฟรี รายงานระบุว่าต้นทุนผู้ให้คะแนนอยู่ที่ประมาณ 12.7% ของต้นทุนการเรียนรู้แบบเสริมกำลังทั้งหมดของ MiMo-V2.6-Pro ตัวเลขเดียวนี้เป็นสิ่งที่มีประโยชน์ที่สุดในบทความสำหรับใครก็ตามที่กำลังพิจารณาจะลอกเลียนวิธีนี้ เพราะมันเปลี่ยน “ขยายผู้ให้คะแนนของคุณ” จากไอเดียให้กลายเป็นรายการในงบประมาณ
เราเตอร์ที่ถูกแช่แข็งคือผลลัพธ์ที่ทีมส่วนใหญ่จะลอกเลียนแบบเป็นอันดับแรก
ส่วนความเสถียรของรายงานมีข้อค้นพบที่ยืนได้ด้วยตัวเอง เป็นอิสระจาก MiMo-V2.6 และเป็นอิสระจากว่าโมเดลจะทำงานได้ดีเพียงใด
ด้วยเราเตอร์แบบ mixture-of-experts ที่ฝึกได้ ภาระของผู้เชี่ยวชาญคลาดเคลื่อนอย่างรุนแรงในช่วง 20 สเต็ป สัมประสิทธิ์การแปรผันระหว่างผู้เชี่ยวชาญเพิ่มขึ้นจาก 0.78 เป็น 2.0 โหลดสูงสุดบนผู้เชี่ยวชาญที่ยุ่งที่สุดเพิ่มจากหกเท่าของค่าเฉลี่ยเป็นสิบหกเท่า สัดส่วนของผู้เชี่ยวชาญเย็น — ผู้ที่ได้รับทราฟฟิกเกือบไม่มี — เพิ่มจาก 0.5% เป็น 22% การคืนค่าน้ำหนักเราเตอร์กลับไปเป็นค่าเริ่มต้นที่สเต็ป 20 ทำให้สมดุลกลับคืนมาทันที
การตอบสนองของ Xiaomi คือการแช่แข็งเราเตอร์ MoE ไว้สำหรับการรันครั้งนี้ เหตุผลไม่ได้ลึกซึ้งอะไร: ที่ขนาดแบตช์ระดับนี้ ความไม่เสถียรของการจัดเส้นทางเป็นปัญหาด้านพลวัตการฝึกที่คุณเลือกที่จะไม่มีได้เลย และเราเตอร์ไม่ใช่จุดที่การเรียนรู้แบบเสริมกำลังทำงานของมัน สิ่งที่ยังไม่ได้รับคำตอบจากการทำ ablation ในเอกสารที่เผยแพร่คือ การแช่แข็งนี้มีต้นทุนต่อคุณภาพสุดท้ายหรือไม่ และนั่นก็เป็นสิ่งที่สมเหตุสมผลที่อยากได้
สิ่งที่ข้อค้นพบนี้ไม่ได้กล่าวถึงเลยก็คือเรื่องการให้บริการ การกระจายโหลดของเราเตอร์ระหว่างการรันเทรนกับการใช้ประโยชน์ของผู้เชี่ยวชาญภายใต้ทราฟฟิกโปรดักชันเป็นคนละคำถาม และรายงานกล่าวถึงเฉพาะคำถามแรกเท่านั้น
ตัวเลขเหล่านี้ พร้อมป้ายกำกับที่แนบอยู่
ผลลัพธ์หัวเรื่องของรายงานนั้นเรียบร้อยในเชิงรูปแบบ แต่ยุ่งเหยิงในรายละเอียด และความยุ่งเหยิงนั้นไม่ใช่เรื่องอื้อฉาว — มันคือการวัดที่แตกต่างกันสามแบบของวัตถุสามสิ่งที่ใช้ชื่อร่วมกัน
• DeepSWE v1.1 แบบ held out — MiMo-V2.6-Pro เพิ่มขึ้นจาก 58.4 เป็น 72.6 ตลอดการรัน; MiMo-V2.6-Flash จาก 48.7 เป็น 65.7 เกณฑ์มาตรฐานนี้คืองานวิศวกรรมรีโพซิทอรีแบบระยะยาว 113 งาน ซึ่งตัดสินโดยตัวตรวจสอบเชิงฟังก์ชันครอบคลุมห้าภาษาการเขียนโปรแกรม และเมตริกคือ average@3 — อัตราผ่านเฉลี่ยของตัวตรวจสอบจากความพยายามที่สุ่มมา 3 ครั้ง ซึ่งไม่เหมือนกับว่ามีความพยายามใดจากสามครั้งนั้นสำเร็จหรือไม่ การอ่าน avg@3 เป็น pass@3 จะทำให้ตัวเลขทุกตัวบนหน้านี้สูงเกินจริง
• เบนช์มาร์กเดียวกัน แต่วัดกันที่อื่น — การ์ดโมเดลที่เผยแพร่ระบุ 71.9 สำหรับ Pro และ 67.9 สำหรับ Flash แดชบอร์ดการเทรนสาธารณะของ Xiaomi แสดง 72.57 และ 65.68 ดังนั้นจึงมีตัวเลขที่เผยแพร่แล้วสามค่าต่อโมเดล โดยสองค่ามาจาก Xiaomi และทิศทางของความคลาดเคลื่อนนั้นแตกต่างกันไปในแต่ละรุ่นพี่น้อง ไม่มีค่าใดผิด พวกมันอธิบายสแนปช็อตของแดชบอร์ด รายการในการ์ด และบรรทัดในรายงาน ณ จุดเวลาที่ต่างกัน และอาจอยู่ภายใต้ฮาร์เนสที่ต่างกัน
• การกลั่น (Distillation) — MiMo-V2.6-Distill-Qwen-9B ซึ่งไฟน์ทูนจาก Qwen3.5-9B ด้วยการสาธิตที่สร้างโดย MiMo ทำให้ SWE-bench Verified เพิ่มจาก 61.1 เป็น 66.2 นี่คือตัวเลขที่นำไปปรับใช้ได้กว้างที่สุดในบทความนี้ เพราะโมเดลนักเรียนขนาด 9B เป็นขนาดที่ทีมส่วนใหญ่สามารถรันได้จริง
• มินิเบนช์มาร์กด้านความมั่นคงปลอดภัยไซเบอร์ภายใน — 31.3 ถึง 47.0 ภายในก็คือภายใน: งานทดสอบเหล่านี้ไม่ได้เผยแพร่ ดังนั้นเดลตาจึงไม่สามารถทำซ้ำได้แม้แต่ในทางหลักการ
• ดัชนี Artificial Analysis Intelligence Index — 46 สำหรับ MiMo-V2.6-Pro ตัวนี้แตกต่างโดยเนื้อแท้ มันถูกสร้างขึ้นโดย Artificial Analysis ที่รันชุดทดสอบของตัวเองกับเช็กพอยต์ที่เผยแพร่ ไม่ใช่โดย Xiaomi ซึ่งทำให้มันเป็นตัวเลขพาดหัวเพียงตัวเดียวในรีลีสนี้ที่ผู้อ่านสามารถมองได้ว่าเป็นค่าที่วัดได้จริงมากกว่าค่าที่รายงานมา อีกทั้งยังเป็นตัวเลขที่ใช้เทียบกับ GLM-5.3, Kimi K3 และแนวหน้าฝั่งปิด และมันอยู่ต่ำกว่า Claude Opus 5 อยู่ห้าคะแนน


รายงานฉบับนี้ซื่อตรงเกี่ยวกับข้อจำกัดของตารางของตัวเอง และนี่คือประโยคที่ควรยกกลับไปกล่าวกับใครก็ตามที่ไม่ได้ซื่อตรงเช่นนั้น: การเปรียบเทียบเหล่านี้นำเกณฑ์มาตรฐานสาธารณะและภายในมาปนกัน และไม่ได้แยกส่วนสนับสนุนของการเรียนรู้แบบเสริมกำลัง (RL) ออกจากสถาปัตยกรรมหรือการฝึกล่วงหน้า โมเดลที่ดีขึ้นหลังจาก RL ไม่ใช่ข้อพิสูจน์ว่า RL คือสาเหตุที่ทำให้ดีขึ้น
มีข้อควรระวังประการที่สอง และเป็นข้อที่ขัดกับกรอบการนำเสนอที่ใช้กันอยู่ ผลตอบแทนที่รายงานโดยทั่วไปมักมาพร้อมกับการใช้โทเคนที่เพิ่มขึ้น รายงานนำเสนอสิ่งนั้นว่าเป็นการพัฒนาความสามารถอย่างต่อเนื่อง มากกว่าจะเป็นเรื่องประสิทธิภาพ และก็ถูกต้องที่ทำเช่นนั้น แต่ GAR ถูกออกแบบมาอย่างชัดเจนเพื่อนำทางไปสู่เส้นทางที่สั้นลงและใช้โทเคนต่องานน้อยลง และผลลัพธ์โดยรวมไม่ได้แสดงให้เห็นว่าภาระงานมีต้นทุนถูกลง ความสามารถเพิ่มขึ้น แต่ต้นทุนต่องานไม่ได้ลดลง หากคุณตีความ “self-improvement” ว่า “โมเดลจะใช้เงินของฉันน้อยลงในไตรมาสหน้า” งานวิจัยชิ้นนี้ไม่สนับสนุนการตีความนั้น
สิ่งที่รายงานปล่อยไว้โดยไม่ได้รับการตรวจสอบยืนยัน
ณ วันที่ 23 กันยายน 2026 ยังไม่มีบุคคลที่สามรายใดเผยแพร่การรันซ้ำอย่างอิสระของคอลัมน์ DeepSWE, Terminal Bench หรือ CyberGym ความแตกต่างที่สำคัญคือระหว่างจุดดัชนีกับสิ่งอื่นทั้งหมด: 46 คือการวัดที่คนอื่นทำไว้ และ 72.6 คือข้ออ้างเกี่ยวกับการรันเทรนที่ไม่มีใครสามารถรันซ้ำได้ เพราะการรันนั้นมีรายงานว่ามีค่าใช้จ่าย 2.6 ล้านดอลลาร์สำหรับ Pro และ 0.9 ล้านดอลลาร์สำหรับ Flash และจะไม่เกิดขึ้นเป็นครั้งที่สอง
สิ่งที่ Xiaomi ได้เผยแพร่ ซึ่งห้องแล็บส่วนใหญ่ไม่ได้ทำ คือพลวัตการฝึก เฟรมเวิร์กการเรียนรู้แบบเสริมกำลัง และสภาพแวดล้อมของงาน — มากกว่า 7,000 สภาพแวดล้อมที่จัดเกรดแล้ว ครอบคลุมวิศวกรรมซอฟต์แวร์ การทำซ้ำช่องโหว่ งานที่ใช้ความรู้ และการออกแบบเว็บ นั่นคือชิ้นงานที่มีอายุการเก็บรักษานานที่สุด น้ำหนักบอกคุณว่าการรันนั้นให้ผลลัพธ์อะไร ส่วนสภาพแวดล้อมบอกคุณว่าจะรันการทดลองด้วยตัวเองได้อย่างไร ซึ่งเป็นวิธีเดียวที่ข้ออ้างใด ๆ เกี่ยวกับ RL จะได้รับการตัดสินในที่สุด
การป้องกัน reward hacking สมควรมีข้อแม้เฉพาะเจาะจง มันถูกอธิบายว่ามีหลายชั้น — การออกแบบรางวัล การประเมินเชิงปรปักษ์ การตรวจจับความผิดปกติ และการตรวจสอบไขว้ระหว่างผู้ตรวจสอบ — และทั้งหมดถูกอธิบายโดยฝ่ายที่จะรู้สึกอับอายหากมันล้มเหลว การป้องกันไม่ให้โมเดลหลอกตัวให้คะแนนที่อิงโมเดลไม่ใช่เรื่องที่การรายงานตนเองจะปิดจบได้ กลไกนี้ถูกระบุชื่อ และโหมดความล้มเหลวก็ได้รับการยอมรับ ซึ่งมากกว่าที่บทความส่วนใหญ่ทำ และมันยังคงเป็นคำถามปลายเปิด
สิ่งที่คุณทำได้จริง ๆ กับสิ่งนี้ในวันนี้
เช็กพอยต์ทั้งสองดาวน์โหลดได้ ไม่มีข้อจำกัด ภายใต้ป้ายสัญญาอนุญาต MIT: Xiaomi MiMo-V2.6-Pro-RL และ Xiaomi MiMo-V2.6-Flash-RL รองรับทุกโมดัล คอนเท็กซ์หนึ่งล้านโทเคน โดยดัชนี Flash รายงานข้อมูลน้ำหนัก 172.9 GB กระจายใน 65 ชาร์ดในรูปแบบ FP8 Xiaomi ยังไม่เผยแพร่ตารางราคาต่อโทเคนสำหรับรุ่น V2.6 ดังนั้นทางเลือกในวันนี้คือการโฮสต์เอง เทียบกับโมเดลแบบโฮสต์ที่คุณจ่ายอยู่แล้ว
การเปรียบเทียบนั้นคือจุดที่คุณค่าของงานวิจัยชิ้นนี้ในโลกจริงตั้งอยู่ และมันก็ไม่ค่อยยกย่องงานวิจัยชิ้นนี้ แต่ให้ผลในทางที่เป็นประโยชน์ ข้อที่กำลังถูกทดสอบไม่ใช่ "MiMo-V2.6-Pro ดีไหม" — คำตอบทั้ง 46 ข้อได้ตอบไปแล้ว หากแต่เป็น "การเรียนรู้แบบเสริมกำลังบนงานแบบเอเจนต์ที่ผสมกัน จะสร้างการให้เหตุผลที่ถ่ายทอดมาสู่ภาระงานของฉันได้หรือไม่" และวิธีตอบอย่างซื่อสัตย์มีเพียงวิธีเดียวคือรันทั้งสองแล้วเปรียบเทียบ ซึ่งนั่นเป็นปัญหาเรื่องการจัดเส้นทางก่อนที่จะเป็นปัญหาเรื่องการวิจัย DeepSeek-V4.1-Flash อยู่ห่างแค่คีย์ API หนึ่งคีย์ ในราคา $0.15 และ $0.60 ต่อล้านโทเค็น, Qwen3.8-Flash และ GLM-5.3-Flash อยู่บนคีย์เดียวกัน, และหากคุณต้องการวางเช็คพอยต์ MiMo ที่โฮสต์เองไว้หลังเอนด์พอยต์เดียวกันเป็นเวลาหนึ่งสัปดาห์ แล้วดูว่าเส้นโค้ง DeepSWE จะปรากฏในการประเมินของคุณเองหรือไม่ นั่นคือการเปลี่ยนการตั้งค่ามากกว่าการย้ายระบบ OrcaRouter ไม่ได้โฮสต์โมเดลของ Xiaomi และไม่ควรตีความสิ่งใดที่นี่ว่าเป็นการอ้างเช่นนั้น — แต่โมเดลที่คุณจะนำมาเปรียบเทียบนั้นล้วนเข้าถึงได้ผ่านคีย์ API เดียวของ OrcaRouter ในราคาตามรายการของผู้ให้บริการ โดยไม่มีมาร์กอัปใด ๆ 0% พร้อมการสลับสำรองอัตโนมัติ หากเช็คพอยต์ที่คุณกำลังทดลองอยู่นั้นไม่เสถียรภายใต้โหลด
กรณีของโมเดลที่ยังไม่ผ่านการพิสูจน์คือกรณีที่ระบบ failover ถูกสร้างขึ้นมาเพื่อรองรับโดยเฉพาะ เช็คพอยต์ที่เผยแพร่เมื่อสองวันก่อน พร้อมการประเมินที่ผู้ขายเป็นผู้รันเอง และไม่มีการรันซ้ำอย่างอิสระ คือสิ่งที่คุณอยากลองใช้งานโดยไม่ต้องเอาเส้นทางโปรดักชันมารองรับไว้ข้างหลังเลย
ใครควรอ่านบทความนี้
ถ้าคุณทำ post-training ให้อ่านส่วนที่เกี่ยวกับข้อค้นพบเรื่อง router และตัวเลขค่าใช้จ่ายของ grader ทั้งสองอย่างนี้ย้ายไปใช้ที่อื่นได้ และทดสอบได้แบบต้นทุนต่ำ โดยไม่ต้องเชื่ออะไรเกี่ยวกับตาราง benchmark ของ MiMo-V2.6 เลย ผลลัพธ์ frozen-router โดยเฉพาะเป็นสิ่งที่ใช้เวลาแค่บ่ายเดียวในการลอง แต่ช่วยประหยัดการรันไปได้หนึ่งรอบ
ถ้าคุณกำลังเลือกโมเดล อ่านแค่ตัวเลขดัชนีแล้วข้ามส่วนที่เหลือไปได้เลย Artificial Analysis วัดได้ 46 บนอาร์ติแฟกต์ที่เปิดตัวออกมา นั่นคือตัวเลขเพียงตัวเดียวในการเปิดตัวครั้งนี้ที่ไม่ได้มาจากผู้จำหน่าย และมันจัดให้ MiMo-V2.6-Pro อยู่บนสุดของกลุ่มโมเดลเปิดน้ำหนัก และตามหลัง Claude Opus 5 อยู่ห้าคะแนน ส่วนอื่น ๆ ทั้งหมดในรายงานอธิบายว่า Xiaomi ไปถึงจุดนั้นได้อย่างไร และวิธีที่ Xiaomi ไปถึงจุดนั้นไม่ใช่สิ่งที่คุณจะซื้อได้
และหากคุณกำลังอ่านบทความที่รายงานข่าวแทนที่จะอ่านตัวงานวิจัย สิ่งที่ต้องจับตาคือคำว่า "self-improvement" ผลลัพธ์ของรายงานเองแสดงให้เห็นว่าความสามารถเพิ่มขึ้นควบคู่ไปกับการใช้โทเคน ซึ่งเป็นข้อค้นพบที่เป็นจริงและทำซ้ำได้เกี่ยวกับการสเกลการเรียนรู้แบบเสริมกำลัง นี่ไม่ใช่ข้ออ้างว่าโมเดลมีต้นทุนการรันถูกลง และงานวิจัยที่ตามมาหลังชิ้นนี้ต่างหากที่จะบอกคุณว่าในที่สุดมันจะถูกลงหรือไม่
