การ์ดฮีโร่เรดาร์โมเดลของ OrcaRouter สำหรับ Xiaomi MiMo-V2.6-Pro โดยมีชื่อโมเดลเป็นชื่อเรื่อง และมีบรรทัด 'น้ำหนักแบบเปิด, 46 บนดัชนี, $0.43 / $0.87' พร้อมด้วยสองแผงที่กำกับว่า 'สิ่งที่เปิดตัว' และ 'ค่าใช้จ่าย'
Guides & Insights

Xiaomi MiMo-V2.6-Pro ขึ้นแท่นอันดับ 1 ใน Open-Weights Index ด้วยคะแนน 46 — พร้อมเปิดเผยบิลค่าเทรน

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Xiaomi MiMo-V2.6-Pro กลายเป็นโมเดลแบบเปิดเวตที่มีอันดับสูงสุดบน Artificial Analysis Intelligence Index ด้วยคะแนน 46 บน v4.3.2 — นำ GLM-5.3 อยู่หนึ่งคะแนน และนำ Kimi K3 อยู่สองคะแนน และสูงกว่าคะแนน 26 ที่ MiMo-V2.5-Pro รุ่นก่อนหน้าทำได้บนมาตรวัดดัชนีแบบเดิมอยู่ยี่สิบคะแนน ตัวเลขนั้นเกิดจาก Artificial Analysis ที่รันชุดทดสอบของตัวเอง ไม่ใช่จาก Xiaomi และนั่นคือข้อเท็จจริงที่มีประโยชน์ที่สุดเพียงหนึ่งเดียวในการเปิดตัวครั้งนี้ ข้อเท็จจริงที่มีประโยชน์รองลงมาคือราคาที่พิมพ์กำกับไว้ข้าง ๆ: 0.43 ดอลลาร์ต่อโทเคนอินพุตหนึ่งล้านโทเคน, 0.87 ดอลลาร์ต่อเอาต์พุตหนึ่งล้านโทเคน เทียบกับ 5.00 และ 25.00 ดอลลาร์สำหรับ Claude Opus 5 — โมเดลที่อยู่ในอันดับสูงกว่าห้าคะแนนดัชนี ข้อที่สามคือสิ่งที่ไม่มีใครคาดว่า Xiaomi จะเปิดเผย: การเปิดบัญชีสาธารณะว่าการรัน reinforcement learning ที่สร้าง MiMo-V2.6-Pro ขึ้นมานั้นมีค่าใช้จ่ายจริงเท่าไร

คะแนนคือการวัด ไม่ใช่คำกล่าวอ้าง

เกือบทุกอย่างที่เผยแพร่เกี่ยวกับการเปิดตัวโมเดลจากจีนมาในรูปแบบตัวเลขจากผู้ขาย และผู้อ่านก็เรียนรู้ที่จะลดทอนความน่าเชื่อถือของมันไปแล้ว ครั้งนี้แตกต่างออกไป และความแตกต่างนั้นก็ควรค่าแก่การอธิบายให้ชัดเจน เพราะการรายงานข่าวการเปิดตัวได้ทำให้มันเลือนรางไปแล้ว

Artificial Analysis ได้ประเมิน MiMo-V2.6-Pro ด้วยตัวเอง บนคอมโพสิต v4.3.2 ซึ่งประกอบด้วยการประเมินสิบรายการที่ครอบคลุมการให้เหตุผล ความรู้ คณิตศาสตร์ และการเขียนโค้ด รวมถึง AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience และ AA-LCR v1.1 46 คือผลลัพธ์ที่ชุดการประเมินนั้นคืนมา นอกจากนี้ยังบันทึกคุณลักษณะการดำเนินงานที่ตัดสินว่าโมเดลจะใช้งานได้จริงหรือเป็นเพียงแค่ดี: 134.3 โทเคนเอาต์พุตต่อวินาที 2.15 วินาทีถึงโทเคนแรก ส่วนลดแคช 99% และต้นทุนที่วัดได้ $0.13 ต่องาน Intelligence Index

สองประการนั้นควรค่าแก่การเน้น 134.3 โทเค็นต่อวินาทีทำให้ MiMo-V2.6-Pro อยู่ในอันดับที่ 11 จาก 114 โมเดลในด้านความเร็ว — สำหรับโมเดล mixture-of-experts ที่มีพารามิเตอร์ระดับล้านล้าน นี่เป็นผลลัพธ์ด้านการให้บริการ ไม่ใช่แค่ผลลัพธ์ด้านการฝึกเทรน และ $0.13 ต่องานคือตัวเลขที่อยู่รอดเมื่อเจอกับงบประมาณ: มันคือค่าใช้จ่ายจริงของดัชนีในการรันกับโมเดลนี้ วัดด้วยวิธีเดียวกันกับทุกโมเดลบนบอร์ด ซึ่งทำให้มันเปรียบเทียบได้ในแบบที่อัตราต่อโทเค็นแบบพาดหัวข่าวไม่สามารถทำได้

Scoreboard card headed 'Xiaomi MiMo-V2.6-Pro — the scoreboard', listing the index score of 46 on Intelligence Index v4.3.2 as the highest of any open-weights model, the open-weights field behind it at GLM-5.3 45 and Kimi K3 44, the top of the same index at Claude Fable 5.1 53, GPT-6 Astra 53 and Claude Opus 5 51, serving at 134.3 output tokens per second and 2.15 seconds to first token, a price of $0.43 in and $0.87 out per million tokens with a 99% cache discount and $0.13 per index task, MIT-licensed weights at 1.02T total and 42B active parameters with a 1M-token context window and text, image, video and audio input, and a route count of one API provider.

สิ่งที่ดัชนีครอบคลุมและไม่ครอบคลุม

มงกุฎโอเพนเวตส์เป็นของจริง แต่แคบกว่าที่ตัวเลขอ่านดู ด้วยคะแนน 46 MiMo-V2.6-Pro นำในหมวดโอเพนเวตส์ แต่ไม่ได้นำในดัชนี อันดับสูงสุดของ v4.3 คือ Claude Fable 5.1 ที่ความพยายามสูงสุดพร้อม default fallback และ GPT-6 Astra ที่ความพยายามสูงสุด ทั้งคู่ได้ 53 โดย Claude Opus 5 อยู่ที่ 51 และ Claude Fable 5 อยู่ที่ 50 ดังนั้นการอธิบายอย่างซื่อตรงคือช่องว่าง 5 คะแนนถึงแนวหน้า บนคะแนนรวมที่ให้รางวัลกับความกว้าง และการปรับปรุง 20 คะแนนจากรุ่นก่อนหน้าของ Xiaomi เอง

• ผู้นำกลุ่มโมเดลโอเพนเวต — Xiaomi MiMo-V2.6-Pro 46, GLM-5.3 (สูงสุด) 45, Kimi K3 (สูงสุด) 44

• อันดับต้นของดัชนีเดียวกัน — Claude Fable 5.1 (max, fallback) 53, GPT-6 Astra (max) 53, Claude Opus 5 (max) 51

• ความเร็ว — 134.3 โทเคนเอาต์พุต/วินาที เป็นอันดับที่ 11 จาก 114 โมเดลที่วัดได้; ค่ามัธยฐานสำหรับคลาสขนาดนี้คือ 77.9

• เวลาถึงโทเคนแรก — 2.15 วินาที เทียบกับค่ามัธยฐาน 2.34 วินาที

• ต้นทุนต่องาน Intelligence Index — $0.13 โดยการประเมินทั้งหมดมีค่าใช้จ่ายในการรัน $206.66

• อัตราตามรายการ — $0.43 ต่อโทเค็นอินพุตหนึ่งล้านโทเค็น, $0.87 ต่อเอาต์พุตหนึ่งล้านโทเค็น, ส่วนลดแคช 99% และราคาเฉลี่ยรวม $0.18 ที่ส่วนผสมแคชฮิต/อินพุต/เอาต์พุต 7:2:1

ตัวเลขหนึ่งบนหน้า Artificial Analysis เป็นข้อควรระวังจริง ๆ มากกว่าคำโอ้อวด: ณ เวลาที่เขียน ตัวเลขนั้นนับผู้ให้บริการ API เพียงรายเดียวสำหรับ MiMo-V2.6-Pro นั่นคือคอขวดในทางปฏิบัติของโมเดลนี้ในตอนนี้ และมันไม่ใช่ปัญหาด้านคุณภาพ — แต่เป็นปัญหาด้านความพร้อมใช้งาน โมเดลที่เข้าถึงได้ผ่านเส้นทางเดียวไม่มีระบบสำรอง หากเส้นทางนั้นมีประสิทธิภาพลดลง แอปพลิเคชันของคุณก็จะลดลงตามไปด้วย และเรื่องของ failover ก็เป็นสิ่งที่เราเตอร์มีไว้เพื่อมอบให้โดยเฉพาะ ข้อสังเกตที่เกี่ยวข้องสำหรับใครก็ตามที่วางแผนโดยอิงกับการเปิดตัวครั้งนี้ คือ เราไม่ได้โฮสต์ MiMo-V2.6-Pro และเราจะไม่แสร้งทำเป็นอย่างอื่น ส่วนเส้นทางไปยังโมเดลนี้ในวันนี้คือแพลตฟอร์มของ Xiaomi เอง และแคตตาล็อกของบุคคลที่สามจำนวนไม่กี่แห่งที่ระบุโมเดลนี้

Screenshot of the Artificial Analysis model page for Xiaomi MiMo-V2.6-Pro, showing the Intelligence Index score of 46 on version 4.3.2, the listed price of $0.43 per million input tokens and $0.87 per million output tokens, a 99% cache discount, output speed of 134.3 tokens per second, time to first token of 2.15 seconds, and the open-weights attribution with the MIT licence.

ตัวเลขสองตัวที่ต้องไม่ปะปนกัน

เสียวหมี่ (Xiaomi) ยังได้เผยแพร่ตัวเลข benchmark ของตัวเอง ซึ่งเป็นสิ่งที่แตกต่างจาก 46 โดยสิ้นเชิง แดชบอร์ดของบริษัทรายงานว่า MiMo-V2.6-Pro ขยับจาก 58.4 ไปเป็น 72.57 บน DeepSWE v1.1 ตลอดการรัน reinforcement learning ของมัน โดยประเมินด้วย mini-swe-agent แบบ average-of-three นั่นคือฮาร์เนสของ Xiaomi ตัวให้คะแนนของ Xiaomi การรันแบบออฟไลน์ของ Xiaomi มันยังไม่ถูกส่งไปยังลีดเดอร์บอร์ด DeepSWE สาธารณะ และยังไม่มีใครทำซ้ำได้

อ่านทั้งสองอย่างเคียงกันแล้วสิ่งล่อใจก็คือการมอง 72.57 เป็นคะแนนที่เทียบเท่ากับ 74% ที่กระดาน DeepSWE สาธารณะระบุไว้ในระดับสูงสุด พวกมันไม่ได้อยู่ในมาตรวัดเดียวกัน ตัวเลขบนกระดานผู้นำคือการกำหนดค่าที่ส่งเข้ามา, Pass@1, พร้อมช่วงความเชื่อมั่นที่เผยแพร่และค่าใช้จ่ายเฉลี่ยต่องาน; ส่วนตัวเลขของผู้ขายคือการประเมินภายในซึ่งไม่มีสิ่งเหล่านั้นแนบมาด้วย บทความของเราเมื่อวันที่ 21 กันยายนได้ชี้ประเด็นนี้ตอนที่ตัวเลขยังเป็นเพียงค่าที่อ่านจากแดชบอร์ด และยังคงใช้ได้แม้ตอนนี้ที่น้ำหนักถูกเปิดเผยออกมาแล้ว ฮาร์เนสของผู้ขายอาจซื่อสัตย์โดยสมบูรณ์และยังไม่ใช่รายการบนกระดานผู้นำ เพราะรายการบนกระดานผู้นำคือข้ออ้างเกี่ยวกับการกำหนดค่าเฉพาะภายใต้เงื่อนไขเฉพาะที่บุคคลที่สามสามารถรันซ้ำได้

ความเข้มงวดแบบเดียวกันนี้ใช้กับค่าใช้จ่ายในการฝึกด้วย Xiaomi รายงานตัวเลขประมาณ $3,474,715 สำหรับการรัน Pro และ Flash — $2,620,670 สำหรับ Pro และ $854,044 สำหรับ Flash — โดยแต่ละรันมีขั้นตอน reinforcement learning มากกว่าสามสิบขั้น และมี trajectories ประมาณ 750,000 เส้นทางต่อรัน เสร็จสิ้นภายในเวลาไม่ถึงหกวัน ตัวเลขเหล่านี้เป็นตัวเลขการคิดต้นทุนคอมพิวต์ของบริษัทเอง สิ่งที่น่าสนใจคือ แล็บแทบไม่เคยเผยแพร่ตัวเลขเหล่านี้ออกมา และมันไม่ใช่ราคา API ไม่ใช่ค่าใช้จ่ายที่คุณจะต้องจ่าย และไม่ใช่ตัวเลขที่บุคคลที่สามรายใดตรวจสอบแล้ว

สิ่งที่ Xiaomi ส่งมอบจริง ๆ

การเปิดตัวครั้งนี้เป็นโมเดล sparse mixture-of-experts ที่มีพารามิเตอร์รวม 1.02 ล้านล้านตัว โดยเปิดใช้งาน 42 พันล้านตัวต่อโทเคน หน้าต่างบริบทขนาด 1 ล้านโทเคน และรองรับมัลติโมดัลแบบเนทีฟทั้งข้อความ รูปภาพ วิดีโอ และเสียง โมเดลพี่น้องอย่าง Xiaomi MiMo-V2.6-Flash มีสถาปัตยกรรมเดียวกันในขนาดที่เล็กกว่า โดยมีพารามิเตอร์รวม 309 พันล้านตัว และเปิดใช้งาน 15 พันล้านตัว น้ำหนักที่เผยแพร่มีแท็กสัญญาอนุญาต MIT และชุดการเปิดตัวประกอบด้วยรายงานทางเทคนิค คำแนะนำในการติดตั้งใช้งาน และ — ตามข้อมูลจาก Xiaomi — สภาพแวดล้อมการฝึกแบบ reinforcement learning และโค้ดที่จำเป็นสำหรับการตรวจสอบและทำซ้ำ post-training

รายการสุดท้ายนั้นคือความแตกต่างเชิงสาระระหว่างการเปิดตัวครั้งนี้กับการประกาศ API ทั่วไป และควรค่าแก่การแยกออกจากส่วนการตลาด การเผยแพร่สภาพแวดล้อม RL คือการอ้างว่าการตั้งค่าการฝึกสามารถตรวจสอบได้ การที่สภาพแวดล้อมที่เผยแพร่นั้นเพียงพอต่อการทำซ้ำผล 72.57 หรือไม่เป็นคำถามอีกข้อหนึ่ง ซึ่งจะได้รับการชี้ขาดโดยผู้ที่ลองทำเอง ไม่ใช่โดยบันทึกการเปิดตัว บันทึกการฝึกของ Xiaomi เองอธิบายการรันที่ผสมงานเขียนโค้ด งานเอเจนต์ทั่วไป งานด้านภาพ และงานความมั่นคงไซเบอร์ไว้ในรอบเดียว โดยมีตัวให้คะแนนที่จัดอันดับเส้นทางที่ประสบความสำเร็จและกระจายรางวัลไปยังเส้นทางที่ดีกว่า และยังบันทึกความล้มเหลวไว้ด้วย: การรีสตาร์ตเนื่องจาก GPU หน่วยความจำเต็มซึ่งเกิดจากความไม่สมดุลของภาระงานระหว่าง expert, ความผิดปกติของเครือข่ายระหว่างคลัสเตอร์สำหรับฝึกกับตัวให้คะแนนที่ติดตั้งใช้งาน และการรีสตาร์ต Flash หลังจากข้อผิดพลาดด้านโครงสร้างพื้นฐานไม่ถูกตรวจพบเป็นเวลาประมาณสามชั่วโมง การเผยแพร่ข้อบกพร่องควบคู่ไปกับความสำเร็จคือส่วนที่ทำให้การเปิดเผยข้อมูลที่เหลือนั้นน่าเชื่อถือ

ค่าบริการในการโทร และคำถามเรื่องการกำหนดเส้นทางอยู่ตรงไหน

ที่ราคา $0.43 และ $0.87 ต่อล้านโทเค็น MiMo-V2.6-Pro ถูกตั้งราคาเหมือนโมเดลระดับกลาง และทำ benchmark ได้เหมือนโมเดล open-weights ระดับแนวหน้า Xiaomi คงราคามาตรฐานของ MiMo-V2.5 เจนเนอเรชันก่อนไว้ แทนที่จะปรับราคา checkpoint ใหม่ให้สูงขึ้น นั่นจึงเป็นเหตุผลว่าทำไมอัตรานี้จึงดูต่ำเมื่อเทียบกับจำนวนพารามิเตอร์ ส่วนลดแคช 99% หมายความว่าลูปเอเจนต์ที่ใช้แคชหนัก ๆ อ่านบริบทของตัวเองได้ในแทบไม่มีค่าใช้จ่าย และนั่นคือจุดที่บิลของเอเจนต์ระยะยาวสะสมจริง ๆ

มีเวอร์ชันหนึ่งของข้อแลกเปลี่ยนนี้ที่จัดเส้นทางได้อย่างราบรื่น และมีอีกเวอร์ชันหนึ่งที่ทำไม่ได้ เวอร์ชันที่ทำได้คือ: โมเดลระดับแนวหน้าที่คุณจะนำมาเปรียบเทียบกับ MiMo-V2.6-Pro — Claude Opus 5 ในราคา $5.00/$25.00, GPT-6 Astra, Gemini 3.8 Flash, GLM-5.3 — ล้วนเข้าถึงได้ผ่านคีย์ OrcaRouter เพียงคีย์เดียว ในราคาตามที่ผู้ให้บริการกำหนด โดยไม่บวกเพิ่มเลย 0% ดังนั้นเมื่อผู้ให้บริการรายใดรายหนึ่งลดราคา ฝั่งเราก็พร้อมใช้ราคานั้นในวันเดียวกัน และกฎการจัดเส้นทางสามารถส่งคำขอไปยังโมเดลที่สองได้เมื่อโมเดลแรกตอบช้าหรือใช้งานไม่ได้ เรื่องนี้สำคัญกว่าปกติในกรณีนี้ เพราะโมเดลที่ได้คะแนนโอเพนเวทส์ดีที่สุดก็เป็นโมเดลที่มีเส้นทางไปถึงได้บางที่สุดเช่นกัน การประกอบสองสิ่งเข้าด้วยกัน — เลนโอเพนเวทส์ราคาถูกสำหรับงานปริมาณมาก และเลนระดับแนวหน้าสำหรับงานหางยาวที่ยาก — คือการตัดสินใจด้านการจัดเส้นทาง และเป็นประเภทของการตัดสินใจที่เลิกเป็นเรื่องของการเดิมพันทันทีที่ทั้งสองเลนอยู่บนคีย์เดียวกัน

ยังมีอีกหนึ่งผลิตภัณฑ์ที่ต้องแยกให้ชัด เพราะเป็นเรื่องง่ายที่จะสับสนปนกับตัวโมเดล: Xiaomi ยังเสนอ MiMo-V2.6-Pro-UltraSpeed ซึ่งเป็นระดับการให้บริการแบบโฮสต์ที่สร้างจากเช็กพอยต์เดียวกัน เอกสารของ Xiaomi เองอ้างว่ามีความเร็วเอาต์พุตสูงถึงยี่สิบเท่าของบริการ Pro มาตรฐานที่คุณภาพเดียวกัน ขณะที่รายการแค็ตตาล็อกของบุคคลที่สามระบุว่าประมาณสิบเท่า นั่นเป็นตัวเลขสองค่าที่ต่างกันซึ่งอธิบายระดับเดียวกัน ไม่มีใครเผยแพร่การแจกแจงเวลาแฝงต่อคำขอที่ทำให้ตัวเลขเหล่านี้สอดคล้องกัน และระดับนี้มีอัตราค่าบริการที่สูงกว่าอย่างมีนัยสำคัญ ไม่มีอะไรใน UltraSpeed ที่เปลี่ยนสิ่งที่ค่าน้ำหนักทำได้ — มันเปลี่ยนแค่ความเร็วที่เซิร์ฟเวอร์ของคนอื่นจะรันค่าน้ำหนักเหล่านั้น

อะไรจะเปลี่ยนแปลงภาพนี้

สามสิ่ง เรียงตามว่าพวกมันจะสำคัญแค่ไหน

เส้นทางการให้บริการเส้นทางที่สองและที่สาม จำนวนผู้ให้บริการรายเดียวบน Artificial Analysis คือข้อจำกัดของทุกสิ่งอื่น การมีเส้นทางมากขึ้นหมายถึงการสลับไปใช้ระบบสำรอง หมายถึงการแข่งขันด้านราคาในชั้นการให้บริการ และหมายถึงว่าโมเดลสามารถถูกนำไปใช้ในเส้นทางการใช้งานจริงได้ แทนที่จะเป็นเพียงการทดลอง

การทำซ้ำตัวเลขของ DeepSWE อย่างอิสระ ค่า 46 นั้นเป็นอิสระอยู่แล้ว ส่วนค่า 72.57 ยังไม่ใช่ หากการรันจากภายนอกให้ผลใกล้เคียงกับค่านั้น ข้อสนับสนุนสำหรับโมเดลก็จะแข็งแกร่งขึ้นอย่างมาก หากได้ผลต่ำกว่าอย่างมีนัยสำคัญ ตัวเลขของ Artificial Analysis ยังคงเป็นตัวเลขที่ควรเชื่อถือ และตัวเลขจากฝั่งผู้ขายจะเข้าร่วมรายการยาวของคำกล่าวอ้างตอนเปิดตัวที่ไม่รอดเมื่อเจอของจริง

Timeline card headed 'MiMo-V2.6-Pro — what was disclosed, and by whom', with six dated rows: 21 September 2026 weights, technical report, deployment instructions and RL environments published; 22 September 2026 Xiaomi's launch page carrying the DeepSWE v1.1 figures and the training-spend accounting; the independent Artificial Analysis score of 46 on v4.3.2; the vendor harness result moving 58.4 to 72.57 on DeepSWE v1.1; the vendor accounting of $2,620,670 for Pro and $854,044 for Flash across the RL runs; and a route count of one API provider.

รายละเอียดแยกตามการประเมินแต่ละรายการ คะแนนคอมโพสิตก็คือคะแนนคอมโพสิต ว่า MiMo-V2.6-Pro ชนะการประเมินสิบรายการใดและแพ้รายการใด คือความแตกต่างระหว่างโมเดลที่คุณนำไปใช้สำหรับการเขียนโค้ดแบบเอเจนต์ กับโมเดลที่คุณนำไปใช้สำหรับการตอบคำถามที่ต้องดึงข้อมูลจำนวนมาก และดัชนีเพียงอย่างเดียวไม่ได้บอกคุณ รายละเอียดตรงนั้นคือสิ่งที่ต้องจับตาดูต่อไป และเป็นสิ่งที่การตั้งค่าการจัดเส้นทางจำเป็นต้องมีก่อนจะคุ้มค่าที่จะจดบันทึกไว้

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube