การ์ดชื่อเรื่องหลักสำหรับบทความ 'MiMo-V2.6: สิ่งที่บทความ RL แสดงให้เห็น' พร้อมข้อความกำกับเหนือชื่อ 'รายงานทางเทคนิค' และคำโปรย 'รายงาน mixed-RL ของ Xiaomi อ่านเพื่อดูว่าอะไรที่ยืนยันได้และอะไรที่ยังไม่ยืนยัน' ชิปทรงมนสี่อันมีข้อความว่า 'เราเตอร์ MoE แบบ Frozen' 'ต้นทุน Grader 12.7%' 'DeepSWE 58.4 ถึง 72.6' และ 'AA Index 46' บรรทัดท้ายระบุว่า 'ตัวเลข DeepSWE เป็นข้อมูลที่ผู้ขายรายงานเอง; AA Index 46 วัดโดย Artificial Analysis' โลโก้ OrcaRouter ถูกซ้อนทับไว้ที่มุมขวาล่าง
Guides & Insights

MiMo-V2.6: สิ่งที่เปเปอร์ RL ของ Xiaomi แสดงให้เห็นจริง ๆ และสิ่งที่ยังคงไม่ได้รับการยืนยัน

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

บทความโมเดลส่วนใหญ่ที่เผยแพร่ในเดือนนี้เป็นบทความเกี่ยวกับสถาปัตยกรรม รายงานทางเทคนิคเบื้องหลัง Xiaomi MiMo-V2.6-Pro และ Xiaomi MiMo-V2.6-Flash ไม่ใช่เช่นนั้น โดยมีชื่อว่า MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement ส่งเมื่อวันที่ 21 กันยายน 2026 และระบุว่าอยู่ในความรับผิดชอบของ LLM-Core Xiaomi เนื้อหาแทบไม่มีส่วนใดกล่าวถึงโครงข่ายหลักแบบ sparse mixture-of-experts เลย และเกือบทั้งหมดทุ่มให้กับคำถามข้อเดียวว่า จะเกิดอะไรขึ้นเมื่องบประมาณการฝึกหลังการฝึก (post-training) ทั้งหมดถูกใช้ไปกับการรัน reinforcement learning แบบผสมเพียงครั้งเดียว ในทางตรงกันข้าม รายงานของ DeepSeek-V4.1-Flash เป็นเอกสารว่าด้วยหน่วยความจำ ความยาวของมันทุ่มให้กับ compressed sparse attention, การใช้ KV ซ้ำข้ามเลเยอร์ และการจัดเก็บแบบ FP4 เมื่อวางสองชิ้นนี้เทียบกัน มันคือข้อโต้แย้งเกี่ยวกับว่าความสามารถนั้นมาจากไหน และทั้งสองไม่เห็นตรงกัน

รายงานนี้ควรค่าแก่การอ่านในแง่ของตัวมันเอง แต่ควรอ่านอย่างระมัดระวัง เพราะมันเป็นรายงานตนเองจากห้องแล็บที่รันการทดลองนั้น มันระบุชื่อกลไกของมัน แสดงการทดลองแบบ ablation เผยแพร่ความล้มเหลวของมัน และในขณะเดียวกันก็รายงานตัวเลขที่ไม่สามารถตรวจสอบจากภายนอกได้ การแยกสองสิ่งนี้ออกจากกันคือส่วนสำคัญที่สุดของงาน ชิ้นนี้ทำเช่นนั้น และเขียนขึ้นเมื่อวันที่ 23 กันยายน 2026 — สองวันหลังจากเช็กพอยต์ถูกอัปโหลดขึ้นไป ขณะที่บทความนี้เป็นสิ่งใหม่ที่สุดและได้รับการยืนยันประกอบน้อยที่สุดเกี่ยวกับเช็กพอยต์เหล่านั้น

ทำไมวันที่บนกระดาษจึงสำคัญกว่าปกติ

เช็กพอยต์ MiMo-V2.6-Pro และ MiMo-V2.6-Flash ของ Xiaomi ถูกปล่อยบนโมเดลฮับเมื่อวันที่ 21 กันยายน 2026 ภายใต้สัญญาอนุญาต MIT และไม่มีการจำกัดการเข้าถึง รายงานฉบับนี้ลงวันที่วันเดียวกัน และติดอันดับต้น ๆ ของรายการเทรนดิงบนเว็บไซต์ preprint ที่เผยแพร่ จังหวะเวลานี้คือเหตุผลที่ชิ้นนี้เป็นข่าวมากกว่าจะเป็นบทความย้อนหลัง: งานวิจัยนี้ไม่ใช่คำอธิบายที่ตามมาทีหลังของโมเดลที่ทุกคนวัดประสิทธิภาพกันไปแล้ว หากแต่มาพร้อมกับเวตของโมเดล ก่อนที่任何人ภายนอก Xiaomi จะเผยแพร่การทดสอบที่เป็นอิสระ

Screenshot of the MiMo-V2.6 technical report page captured September 23, 2026, showing the title 'MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement', attributed to LLM-Core Xiaomi and dated 21 September 2026, with the author list and the opening of the abstract visible.

การจัดเรียงนั้นก็เป็นจุดอ่อนหลักของงานวิจัยนี้ในฐานะหลักฐานเช่นกัน ทุกสิ่งที่เป็นผลสืบเนื่องมาจากมัน — เส้นโค้ง DeepSWE, การเพิ่มขึ้นของอัตราการผ่าน, การป้องกันการแฮ็กผลตอบแทน — เป็นข้อกล่าวอ้างเกี่ยวกับกระบวนการฝึกที่เกิดขึ้นครั้งเดียว ในห้องแล็บเดียว บนคลัสเตอร์เดียว และไม่มีใครอื่นทำซ้ำได้ กระทู้ที่ตั้งข้อสังเกตเกี่ยวกับรายงานนี้มองว่านั่นเป็นส่วนที่น่าสนใจ: นี่เป็นงานวิจัยด้านข้อมูลและการทดลอง ไม่ใช่งานวิจัยด้านสถาปัตยกรรม และการทดลองก็เป็นผลลัพธ์ประเภทที่ทำซ้ำได้หรือไม่ได้เท่านั้น

สามแกนของการขยายระบบ และมีเพียงหนึ่งในนั้นที่เป็นปัญหาฮาร์ดแวร์

การวางกรอบของรายงานก็คือ การประมวลผลสำหรับการเรียนรู้แบบเสริมกำลังถูกขยายไปพร้อมกันในสามแกน และแกนที่สามคือแกนที่เปลี่ยนวิธีที่คุณคิดเกี่ยวกับวิธีการนี้

• แบตช์และอัตราการประมวลผล — 1,568 ตัวอย่างต่อการอัปเดต โดยแต่ละตัวอย่างขยายเป็น 16 โรลเอาต์ ดังนั้นจึงมีวิถีประมาณ 25,000 วิถีต่อขั้นตอน ซึ่งใช้โทเคน 2.7 ถึง 3.7 พันล้านโทเคนต่อขั้นตอน ที่ความยาวคอนเท็กซ์สูงสุดถึงหนึ่งล้านโทเคน สถาปัตยกรรมโรลเอาต์เป็นแบบอะซิงโครนัสเต็มรูปแบบ ซึ่งเป็นสิ่งที่ทำให้ขนาดแบตช์นั้นพอจะอยู่รอดได้เลย

• สภาพแวดล้อม — การรันแบบผสมผสานเดียวข้ามงานด้านโค้ด, เอเจนต์ทั่วไป, งานภาพและไซเบอร์ ภายใต้ฮาร์เนสของเอเจนต์หลายตัวพร้อมกัน แทนที่จะเป็นการรัน RL แยกตามโดเมน ชื่อย่อของ Xiaomi เองสำหรับสิ่งนี้คือ "You Only RL Once" ข้อโต้แย้งสำหรับการผสมผสานคือความก้าวหน้าในความสามารถหนึ่งจะเสริมความสามารถอื่นๆ; ความเสี่ยงคือประเภทงานที่ช้ากว่าจะขาดแคลน ซึ่งรายงานกล่าวว่าจัดการได้ด้วยการจัดตารางแบบปรับตัว

• Grader compute — แกนที่ไม่ได้เกี่ยวกับ GPU ในความหมายปกติ การผ่าน/ไม่ผ่านแบบทวิภาคไม่สามารถจัดอันดับสองวิธีแก้ไขที่ผ่านทั้งคู่ได้ ดังนั้นสัญญาณรางวัลเองจึงกลายเป็นสิ่งที่คุณต้องขยาย ตัวให้คะแนนแบบเอเจนติกจะเปรียบเทียบความพยายามสิบหกครั้งสำหรับงานหนึ่งพร้อมกัน และสร้างสัญญาณแบบมีระดับแทนที่จะเป็นบิต

แกนที่สามคือจุดที่วลี “self-improvement” ในชื่อเรื่องได้ที่ยืนของมัน และเป็นจุดที่รายงานเปราะบางที่สุด การที่โมเดลให้คะแนนโรลเอาต์ของตัวเองถือเป็นพื้นผิวสำหรับ reward hacking และรายงานก็ปฏิบัติต่อมันเช่นนั้น

สองกลไกที่ควรค่าแก่การทำความเข้าใจจริง ๆ

การกระจายข้อได้เปรียบแบบกลุ่ม

หลังจากแต่ละขั้นตอน นโยบายจะสร้างความพยายามสิบหกครั้งต่อหนึ่งงาน และทั้งหมดจะถูกวางไว้ในพื้นที่ทำงานร่วมกัน เพื่อให้โมเดลผู้ประเมินสามารถตรวจสอบพร้อมกันได้แทนที่จะตรวจทีละรายการ จากนั้นแพตช์ที่ผ่านจะถูกให้คะแนนในห้ามิติ ได้แก่ แนวทางเหมาะสมกับปัญหาหรือไม่ การนำไปใช้แม่นยำโดยไม่มีกลไกสำรองที่ไม่จำเป็นหรือไม่ การเปลี่ยนแปลงน้อยที่สุดหรือไม่ มีการแก้ไขสิ่งใดนอกขอบเขตหรือไม่ และสอดคล้องกับสไตล์โค้ดโดยรอบหรือไม่ แพตช์ที่ผ่านซึ่งมีอันดับต่ำกว่าจะได้รับการเสริมแรงเชิงบวกน้อยลง แพตช์ที่ยืนยันว่าเป็นแฮ็กจะถูกรีเซ็ตเป็นศูนย์และถือว่าเป็นความล้มเหลว

ผลลัพธ์ก็คือสัญญาณการฝึกที่ผลักดันไปสู่แนวทางแก้ปัญหาที่สั้นลงและมีต้นทุนต่ำลง แทนที่จะเป็นเพียงแนวทางที่ถูกต้องเท่านั้น — รายงานอธิบายสิ่งนี้ว่าเป็นการชี้นำไปสู่การใช้โทเคนต่องานให้น้อยลง นั่นคือส่วนที่ควรจับไว้ให้มั่น เพราะผลลัพธ์หลักในช่วงหลังของบทความชี้ไปในทิศทางตรงกันข้าม

การสังเคราะห์รางวัลแบบรายกลุ่ม

อีกครึ่งหนึ่งแบบออฟไลน์ของแนวคิดเดียวกัน แทนที่จะได้คุณภาพมาจากตัวให้คะแนนแบบสดเพียงอย่างเดียว ทีมจะคำนวณรูบริกเฉพาะงานไว้ล่วงหน้า และคูณรางวัลจากการทดสอบแบบไบนารีด้วยคะแนนคุณภาพและคะแนนพฤติกรรมที่ดึงมาจากรูบริกเหล่านั้น รายงานอธิบายสิ่งนี้ว่าเป็นการสร้างรูบริกจากการโรลเอาต์ที่แตกต่างกัน กล่าวคือ จากกรณีที่ผลลัพธ์แตกต่างกัน ซึ่งเป็นจุดที่มีข้อมูลอยู่

การให้คะแนนไม่ได้มาฟรี รายงานระบุว่าต้นทุนผู้ให้คะแนนอยู่ที่ประมาณ 12.7% ของต้นทุนการเรียนรู้แบบเสริมกำลังทั้งหมดของ MiMo-V2.6-Pro ตัวเลขเดียวนี้เป็นสิ่งที่มีประโยชน์ที่สุดในบทความสำหรับใครก็ตามที่กำลังพิจารณาจะลอกเลียนวิธีนี้ เพราะมันเปลี่ยน “ขยายผู้ให้คะแนนของคุณ” จากไอเดียให้กลายเป็นรายการในงบประมาณ

เราเตอร์ที่ถูกแช่แข็งคือผลลัพธ์ที่ทีมส่วนใหญ่จะลอกเลียนแบบเป็นอันดับแรก

ส่วนความเสถียรของรายงานมีข้อค้นพบที่ยืนได้ด้วยตัวเอง เป็นอิสระจาก MiMo-V2.6 และเป็นอิสระจากว่าโมเดลจะทำงานได้ดีเพียงใด

ด้วยเราเตอร์แบบ mixture-of-experts ที่ฝึกได้ ภาระของผู้เชี่ยวชาญคลาดเคลื่อนอย่างรุนแรงในช่วง 20 สเต็ป สัมประสิทธิ์การแปรผันระหว่างผู้เชี่ยวชาญเพิ่มขึ้นจาก 0.78 เป็น 2.0 โหลดสูงสุดบนผู้เชี่ยวชาญที่ยุ่งที่สุดเพิ่มจากหกเท่าของค่าเฉลี่ยเป็นสิบหกเท่า สัดส่วนของผู้เชี่ยวชาญเย็น — ผู้ที่ได้รับทราฟฟิกเกือบไม่มี — เพิ่มจาก 0.5% เป็น 22% การคืนค่าน้ำหนักเราเตอร์กลับไปเป็นค่าเริ่มต้นที่สเต็ป 20 ทำให้สมดุลกลับคืนมาทันที

การตอบสนองของ Xiaomi คือการแช่แข็งเราเตอร์ MoE ไว้สำหรับการรันครั้งนี้ เหตุผลไม่ได้ลึกซึ้งอะไร: ที่ขนาดแบตช์ระดับนี้ ความไม่เสถียรของการจัดเส้นทางเป็นปัญหาด้านพลวัตการฝึกที่คุณเลือกที่จะไม่มีได้เลย และเราเตอร์ไม่ใช่จุดที่การเรียนรู้แบบเสริมกำลังทำงานของมัน สิ่งที่ยังไม่ได้รับคำตอบจากการทำ ablation ในเอกสารที่เผยแพร่คือ การแช่แข็งนี้มีต้นทุนต่อคุณภาพสุดท้ายหรือไม่ และนั่นก็เป็นสิ่งที่สมเหตุสมผลที่อยากได้

สิ่งที่ข้อค้นพบนี้ไม่ได้กล่าวถึงเลยก็คือเรื่องการให้บริการ การกระจายโหลดของเราเตอร์ระหว่างการรันเทรนกับการใช้ประโยชน์ของผู้เชี่ยวชาญภายใต้ทราฟฟิกโปรดักชันเป็นคนละคำถาม และรายงานกล่าวถึงเฉพาะคำถามแรกเท่านั้น

ตัวเลขเหล่านี้ พร้อมป้ายกำกับที่แนบอยู่

ผลลัพธ์หัวเรื่องของรายงานนั้นเรียบร้อยในเชิงรูปแบบ แต่ยุ่งเหยิงในรายละเอียด และความยุ่งเหยิงนั้นไม่ใช่เรื่องอื้อฉาว — มันคือการวัดที่แตกต่างกันสามแบบของวัตถุสามสิ่งที่ใช้ชื่อร่วมกัน

• DeepSWE v1.1 แบบ held out — MiMo-V2.6-Pro เพิ่มขึ้นจาก 58.4 เป็น 72.6 ตลอดการรัน; MiMo-V2.6-Flash จาก 48.7 เป็น 65.7 เกณฑ์มาตรฐานนี้คืองานวิศวกรรมรีโพซิทอรีแบบระยะยาว 113 งาน ซึ่งตัดสินโดยตัวตรวจสอบเชิงฟังก์ชันครอบคลุมห้าภาษาการเขียนโปรแกรม และเมตริกคือ average@3 — อัตราผ่านเฉลี่ยของตัวตรวจสอบจากความพยายามที่สุ่มมา 3 ครั้ง ซึ่งไม่เหมือนกับว่ามีความพยายามใดจากสามครั้งนั้นสำเร็จหรือไม่ การอ่าน avg@3 เป็น pass@3 จะทำให้ตัวเลขทุกตัวบนหน้านี้สูงเกินจริง

• เบนช์มาร์กเดียวกัน แต่วัดกันที่อื่น — การ์ดโมเดลที่เผยแพร่ระบุ 71.9 สำหรับ Pro และ 67.9 สำหรับ Flash แดชบอร์ดการเทรนสาธารณะของ Xiaomi แสดง 72.57 และ 65.68 ดังนั้นจึงมีตัวเลขที่เผยแพร่แล้วสามค่าต่อโมเดล โดยสองค่ามาจาก Xiaomi และทิศทางของความคลาดเคลื่อนนั้นแตกต่างกันไปในแต่ละรุ่นพี่น้อง ไม่มีค่าใดผิด พวกมันอธิบายสแนปช็อตของแดชบอร์ด รายการในการ์ด และบรรทัดในรายงาน ณ จุดเวลาที่ต่างกัน และอาจอยู่ภายใต้ฮาร์เนสที่ต่างกัน

• การกลั่น (Distillation) — MiMo-V2.6-Distill-Qwen-9B ซึ่งไฟน์ทูนจาก Qwen3.5-9B ด้วยการสาธิตที่สร้างโดย MiMo ทำให้ SWE-bench Verified เพิ่มจาก 61.1 เป็น 66.2 นี่คือตัวเลขที่นำไปปรับใช้ได้กว้างที่สุดในบทความนี้ เพราะโมเดลนักเรียนขนาด 9B เป็นขนาดที่ทีมส่วนใหญ่สามารถรันได้จริง

• มินิเบนช์มาร์กด้านความมั่นคงปลอดภัยไซเบอร์ภายใน — 31.3 ถึง 47.0 ภายในก็คือภายใน: งานทดสอบเหล่านี้ไม่ได้เผยแพร่ ดังนั้นเดลตาจึงไม่สามารถทำซ้ำได้แม้แต่ในทางหลักการ

• ดัชนี Artificial Analysis Intelligence Index — 46 สำหรับ MiMo-V2.6-Pro ตัวนี้แตกต่างโดยเนื้อแท้ มันถูกสร้างขึ้นโดย Artificial Analysis ที่รันชุดทดสอบของตัวเองกับเช็กพอยต์ที่เผยแพร่ ไม่ใช่โดย Xiaomi ซึ่งทำให้มันเป็นตัวเลขพาดหัวเพียงตัวเดียวในรีลีสนี้ที่ผู้อ่านสามารถมองได้ว่าเป็นค่าที่วัดได้จริงมากกว่าค่าที่รายงานมา อีกทั้งยังเป็นตัวเลขที่ใช้เทียบกับ GLM-5.3, Kimi K3 และแนวหน้าฝั่งปิด และมันอยู่ต่ำกว่า Claude Opus 5 อยู่ห้าคะแนน

A scoreboard card titled 'Published by Xiaomi vs verified from outside', subtitled 'Every headline figure in the report, and who stands behind it', with columns 'Dimension', 'In the report' and 'Independent status'. Rows read: DeepSWE v1.1, held out — 58.4 to 72.6 Pro; 48.7 to 65.7 Flash, average@3 — No third-party rerun; Released model card — 71.9 Pro; 67.9 Flash — Vendor-published; Public training dashboard — 72.57 Pro; 65.68 Flash — Vendor-published; Distill-Qwen-9B — SWE-bench Verified 61.1 to 66.2 — No third-party rerun; Internal cyber benchmark — 31.3 to 47.0 — Tasks not published; AA Intelligence Index — 46 for MiMo-V2.6-Pro — Measured by Artificial Analysis. A footer reads 'DeepSWE, card and dashboard figures are vendor-reported and have not been independently reproduced; the internal benchmark tasks are not published. The AA Intelligence Index is the one headline number produced outside Xiaomi.' The OrcaRouter logo is composited in the bottom-right corner.Screenshot of the Artificial Analysis model page for MiMo-V2.6-Pro captured September 23, 2026, showing an Intelligence Index of 46, an Intelligence versus Cost scatter placing MiMo-V2.6-Pro against Kimi K3, Claude Opus 5 and other frontier models, and a comparison table of the same models.

รายงานฉบับนี้ซื่อตรงเกี่ยวกับข้อจำกัดของตารางของตัวเอง และนี่คือประโยคที่ควรยกกลับไปกล่าวกับใครก็ตามที่ไม่ได้ซื่อตรงเช่นนั้น: การเปรียบเทียบเหล่านี้นำเกณฑ์มาตรฐานสาธารณะและภายในมาปนกัน และไม่ได้แยกส่วนสนับสนุนของการเรียนรู้แบบเสริมกำลัง (RL) ออกจากสถาปัตยกรรมหรือการฝึกล่วงหน้า โมเดลที่ดีขึ้นหลังจาก RL ไม่ใช่ข้อพิสูจน์ว่า RL คือสาเหตุที่ทำให้ดีขึ้น

มีข้อควรระวังประการที่สอง และเป็นข้อที่ขัดกับกรอบการนำเสนอที่ใช้กันอยู่ ผลตอบแทนที่รายงานโดยทั่วไปมักมาพร้อมกับการใช้โทเคนที่เพิ่มขึ้น รายงานนำเสนอสิ่งนั้นว่าเป็นการพัฒนาความสามารถอย่างต่อเนื่อง มากกว่าจะเป็นเรื่องประสิทธิภาพ และก็ถูกต้องที่ทำเช่นนั้น แต่ GAR ถูกออกแบบมาอย่างชัดเจนเพื่อนำทางไปสู่เส้นทางที่สั้นลงและใช้โทเคนต่องานน้อยลง และผลลัพธ์โดยรวมไม่ได้แสดงให้เห็นว่าภาระงานมีต้นทุนถูกลง ความสามารถเพิ่มขึ้น แต่ต้นทุนต่องานไม่ได้ลดลง หากคุณตีความ “self-improvement” ว่า “โมเดลจะใช้เงินของฉันน้อยลงในไตรมาสหน้า” งานวิจัยชิ้นนี้ไม่สนับสนุนการตีความนั้น

สิ่งที่รายงานปล่อยไว้โดยไม่ได้รับการตรวจสอบยืนยัน

ณ วันที่ 23 กันยายน 2026 ยังไม่มีบุคคลที่สามรายใดเผยแพร่การรันซ้ำอย่างอิสระของคอลัมน์ DeepSWE, Terminal Bench หรือ CyberGym ความแตกต่างที่สำคัญคือระหว่างจุดดัชนีกับสิ่งอื่นทั้งหมด: 46 คือการวัดที่คนอื่นทำไว้ และ 72.6 คือข้ออ้างเกี่ยวกับการรันเทรนที่ไม่มีใครสามารถรันซ้ำได้ เพราะการรันนั้นมีรายงานว่ามีค่าใช้จ่าย 2.6 ล้านดอลลาร์สำหรับ Pro และ 0.9 ล้านดอลลาร์สำหรับ Flash และจะไม่เกิดขึ้นเป็นครั้งที่สอง

สิ่งที่ Xiaomi ได้เผยแพร่ ซึ่งห้องแล็บส่วนใหญ่ไม่ได้ทำ คือพลวัตการฝึก เฟรมเวิร์กการเรียนรู้แบบเสริมกำลัง และสภาพแวดล้อมของงาน — มากกว่า 7,000 สภาพแวดล้อมที่จัดเกรดแล้ว ครอบคลุมวิศวกรรมซอฟต์แวร์ การทำซ้ำช่องโหว่ งานที่ใช้ความรู้ และการออกแบบเว็บ นั่นคือชิ้นงานที่มีอายุการเก็บรักษานานที่สุด น้ำหนักบอกคุณว่าการรันนั้นให้ผลลัพธ์อะไร ส่วนสภาพแวดล้อมบอกคุณว่าจะรันการทดลองด้วยตัวเองได้อย่างไร ซึ่งเป็นวิธีเดียวที่ข้ออ้างใด ๆ เกี่ยวกับ RL จะได้รับการตัดสินในที่สุด

การป้องกัน reward hacking สมควรมีข้อแม้เฉพาะเจาะจง มันถูกอธิบายว่ามีหลายชั้น — การออกแบบรางวัล การประเมินเชิงปรปักษ์ การตรวจจับความผิดปกติ และการตรวจสอบไขว้ระหว่างผู้ตรวจสอบ — และทั้งหมดถูกอธิบายโดยฝ่ายที่จะรู้สึกอับอายหากมันล้มเหลว การป้องกันไม่ให้โมเดลหลอกตัวให้คะแนนที่อิงโมเดลไม่ใช่เรื่องที่การรายงานตนเองจะปิดจบได้ กลไกนี้ถูกระบุชื่อ และโหมดความล้มเหลวก็ได้รับการยอมรับ ซึ่งมากกว่าที่บทความส่วนใหญ่ทำ และมันยังคงเป็นคำถามปลายเปิด

สิ่งที่คุณทำได้จริง ๆ กับสิ่งนี้ในวันนี้

เช็กพอยต์ทั้งสองดาวน์โหลดได้ ไม่มีข้อจำกัด ภายใต้ป้ายสัญญาอนุญาต MIT: Xiaomi MiMo-V2.6-Pro-RL และ Xiaomi MiMo-V2.6-Flash-RL รองรับทุกโมดัล คอนเท็กซ์หนึ่งล้านโทเคน โดยดัชนี Flash รายงานข้อมูลน้ำหนัก 172.9 GB กระจายใน 65 ชาร์ดในรูปแบบ FP8 Xiaomi ยังไม่เผยแพร่ตารางราคาต่อโทเคนสำหรับรุ่น V2.6 ดังนั้นทางเลือกในวันนี้คือการโฮสต์เอง เทียบกับโมเดลแบบโฮสต์ที่คุณจ่ายอยู่แล้ว

การเปรียบเทียบนั้นคือจุดที่คุณค่าของงานวิจัยชิ้นนี้ในโลกจริงตั้งอยู่ และมันก็ไม่ค่อยยกย่องงานวิจัยชิ้นนี้ แต่ให้ผลในทางที่เป็นประโยชน์ ข้อที่กำลังถูกทดสอบไม่ใช่ "MiMo-V2.6-Pro ดีไหม" — คำตอบทั้ง 46 ข้อได้ตอบไปแล้ว หากแต่เป็น "การเรียนรู้แบบเสริมกำลังบนงานแบบเอเจนต์ที่ผสมกัน จะสร้างการให้เหตุผลที่ถ่ายทอดมาสู่ภาระงานของฉันได้หรือไม่" และวิธีตอบอย่างซื่อสัตย์มีเพียงวิธีเดียวคือรันทั้งสองแล้วเปรียบเทียบ ซึ่งนั่นเป็นปัญหาเรื่องการจัดเส้นทางก่อนที่จะเป็นปัญหาเรื่องการวิจัย DeepSeek-V4.1-Flash อยู่ห่างแค่คีย์ API หนึ่งคีย์ ในราคา $0.15 และ $0.60 ต่อล้านโทเค็น, Qwen3.8-Flash และ GLM-5.3-Flash อยู่บนคีย์เดียวกัน, และหากคุณต้องการวางเช็คพอยต์ MiMo ที่โฮสต์เองไว้หลังเอนด์พอยต์เดียวกันเป็นเวลาหนึ่งสัปดาห์ แล้วดูว่าเส้นโค้ง DeepSWE จะปรากฏในการประเมินของคุณเองหรือไม่ นั่นคือการเปลี่ยนการตั้งค่ามากกว่าการย้ายระบบ OrcaRouter ไม่ได้โฮสต์โมเดลของ Xiaomi และไม่ควรตีความสิ่งใดที่นี่ว่าเป็นการอ้างเช่นนั้น — แต่โมเดลที่คุณจะนำมาเปรียบเทียบนั้นล้วนเข้าถึงได้ผ่านคีย์ API เดียวของ OrcaRouter ในราคาตามรายการของผู้ให้บริการ โดยไม่มีมาร์กอัปใด ๆ 0% พร้อมการสลับสำรองอัตโนมัติ หากเช็คพอยต์ที่คุณกำลังทดลองอยู่นั้นไม่เสถียรภายใต้โหลด

กรณีของโมเดลที่ยังไม่ผ่านการพิสูจน์คือกรณีที่ระบบ failover ถูกสร้างขึ้นมาเพื่อรองรับโดยเฉพาะ เช็คพอยต์ที่เผยแพร่เมื่อสองวันก่อน พร้อมการประเมินที่ผู้ขายเป็นผู้รันเอง และไม่มีการรันซ้ำอย่างอิสระ คือสิ่งที่คุณอยากลองใช้งานโดยไม่ต้องเอาเส้นทางโปรดักชันมารองรับไว้ข้างหลังเลย

ใครควรอ่านบทความนี้

ถ้าคุณทำ post-training ให้อ่านส่วนที่เกี่ยวกับข้อค้นพบเรื่อง router และตัวเลขค่าใช้จ่ายของ grader ทั้งสองอย่างนี้ย้ายไปใช้ที่อื่นได้ และทดสอบได้แบบต้นทุนต่ำ โดยไม่ต้องเชื่ออะไรเกี่ยวกับตาราง benchmark ของ MiMo-V2.6 เลย ผลลัพธ์ frozen-router โดยเฉพาะเป็นสิ่งที่ใช้เวลาแค่บ่ายเดียวในการลอง แต่ช่วยประหยัดการรันไปได้หนึ่งรอบ

ถ้าคุณกำลังเลือกโมเดล อ่านแค่ตัวเลขดัชนีแล้วข้ามส่วนที่เหลือไปได้เลย Artificial Analysis วัดได้ 46 บนอาร์ติแฟกต์ที่เปิดตัวออกมา นั่นคือตัวเลขเพียงตัวเดียวในการเปิดตัวครั้งนี้ที่ไม่ได้มาจากผู้จำหน่าย และมันจัดให้ MiMo-V2.6-Pro อยู่บนสุดของกลุ่มโมเดลเปิดน้ำหนัก และตามหลัง Claude Opus 5 อยู่ห้าคะแนน ส่วนอื่น ๆ ทั้งหมดในรายงานอธิบายว่า Xiaomi ไปถึงจุดนั้นได้อย่างไร และวิธีที่ Xiaomi ไปถึงจุดนั้นไม่ใช่สิ่งที่คุณจะซื้อได้

และหากคุณกำลังอ่านบทความที่รายงานข่าวแทนที่จะอ่านตัวงานวิจัย สิ่งที่ต้องจับตาคือคำว่า "self-improvement" ผลลัพธ์ของรายงานเองแสดงให้เห็นว่าความสามารถเพิ่มขึ้นควบคู่ไปกับการใช้โทเคน ซึ่งเป็นข้อค้นพบที่เป็นจริงและทำซ้ำได้เกี่ยวกับการสเกลการเรียนรู้แบบเสริมกำลัง นี่ไม่ใช่ข้ออ้างว่าโมเดลมีต้นทุนการรันถูกลง และงานวิจัยที่ตามมาหลังชิ้นนี้ต่างหากที่จะบอกคุณว่าในที่สุดมันจะถูกลงหรือไม่

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube