การ์ดชื่อเรื่องหลักสำหรับบทความ 'Xiaomi MiMo-V2.6-Pro: 72.57 บน DeepSWE' นำด้วยคำโปรย 'OrcaRouter · เรดาร์โมเดล — ยังไม่เปิดตัว' พร้อมคำบรรยายใต้ชื่อ 'การรันที่หยุดไป โมเดลที่ยังไม่วางจำหน่าย — อะไรยืนยันแล้ว และอะไรยังไม่ยืนยัน' ด้านล่างมีสองการ์ด: ซ้าย 'บนแดชบอร์ดของ Xiaomi เอง' ระบุว่า 'DeepSWE v1.1: 72.57 — การรันหยุดที่ขั้นตอนที่ 30, 20 ก.ย.'; ขวา 'ยังไม่เผยแพร่' ระบุว่า 'ไม่มี model card, ไม่มี API id, ไม่มีราคา, ไม่มี weights' ชิปสี่รายการระบุว่า 'Flash sibling: 65.68', 'ค่าใช้จ่ายรวม: $3,474,715', 'อันดับสูงสุดของบอร์ด: 74%' และ 'การประเมินที่ผู้ขายรันเอง ไม่ได้ส่งเข้าประเมิน' โลโก้ OrcaRouter ถูกคอมโพสิตไว้ที่มุมขวาล่าง
Guides & Insights

Xiaomi MiMo-V2.6-Pro: คะแนน DeepSWE 72.57 การรันที่หยุดชะงัก และยังไม่มีกำหนดวางจำหน่าย

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Xiaomi MiMo-V2.6-Pro หยุดการรันการเรียนรู้แบบเสริมกำลังที่ถ่ายทอดสู่สาธารณะเมื่อวันที่ 20 กันยายน ด้วยคะแนน DeepSWE v1.1 ที่ 72.57 ซึ่งปรากฏอยู่บนแดชบอร์ดของ Xiaomi เอง — ต่ำกว่า 74% ที่ GPT-6 Astra, Gemini 3.8 Flash และ Claude Opus 5 ครองตำแหน่งสูงสุดร่วมกันบนลีดเดอร์บอร์ดเดียวกันอยู่ 1.4 จุด Xiaomi MiMo-V2.6-Flash โมเดลขนาดเล็กที่ฝึกไปพร้อมกัน หยุดเมื่อวันที่ 19 กันยายน ที่ 65.68 การรันทั้งสองครั้งสิ้นสุดที่สเต็ป 30 และบิลรวมที่ Xiaomi เผยแพร่ควบคู่กันระบุว่า $3,474,715 เมื่อเราบันทึกหน้าเว็บนี้เมื่อเช้านี้

นั่นคือทั้งหมดของข่าวดี และมันเป็นข่าวดีจริงๆ ส่วนที่เหลือของเรื่องราวคือช่องว่างระหว่างตัวเลขกับผลิตภัณฑ์ ทั้ง Xiaomi MiMo-V2.6-Pro และ Xiaomi MiMo-V2.6-Flash ต่างไม่มีวันวางจำหน่าย ไม่มีการ์ดโมเดล ไม่มีตัวระบุ API ไม่มีราคาที่เผยแพร่ และไม่มีชุดน้ำหนักที่ดาวน์โหลดได้ ไม่มีเอนด์พอยต์ให้เรียกใช้ สิ่งที่มีอยู่คือแดชบอร์ดการฝึกอบรมที่ใครๆ ก็ดูได้ ตัวเลขเบนช์มาร์กที่ชุดทดสอบของ Xiaomi เองสร้างขึ้น และชุมชนที่ใช้เวลาหกวันอ่านหน้าเทเลเมทรีเหมือนกับที่ผู้คนเคยอ่านใบชา

นี่คือบทความแบบเท่าที่เรารู้กันถึงตอนนี้ และฉบับที่ซื่อตรงของมันจะแยกสามสิ่งที่การรายงานข่าวในสัปดาห์ที่ผ่านมาได้ปนเข้าด้วยกันอย่างเงียบ ๆ ออกมา ได้แก่ สิ่งที่ Xiaomi ได้ประกาศอย่างเป็นทางการ สิ่งที่ผู้สังเกตการณ์เพียงรายเดียวรายงานเกี่ยวกับเรื่องนี้ และทั้งหมดนั้นหมายความว่าอย่างไรสำหรับคนที่กำลังเลือกโมเดลเขียนโค้ดในวันนี้

สิ่งที่ Xiaomi โพสต์ออนไลน์จริง ๆ

เมื่อวันที่ 16 กันยายน ทีม MiMo ซึ่งนำโดย Luo Fuli ได้เปิดหน้าถ่ายทอดสดบนโดเมนของ Xiaomi เอง เพื่อแสดงขั้นตอน post-training ของโมเดลที่ยังไม่เปิดตัวสองตัวแบบเรียลไทม์ ได้แก่ จำนวนสเต็ป เส้นโค้งรางวัล อัตราการประมวลผลโทเคน จำนวนแซนด์บ็อกซ์ การแจ้งเตือนข้อขัดข้องของ GPU และตัวนับค่าใช้จ่ายที่เพิ่มขึ้นเรื่อย ๆ ขณะที่คุณเฝ้าดู การวางกรอบของ Xiaomi ตามรายงานข่าวคือ บริษัทใช้เวลาประมาณหกเดือนในการศึกษาคำถามหนึ่งข้อ — การเรียนรู้แบบเสริมกำลังสามารถขยายขนาดได้ไกลแค่ไหน — และตัดสินใจทำการทดลองนั้นต่อสาธารณะ แทนที่จะประกาศผลลัพธ์

แดชบอร์ดนี้เปิดเผยอย่างตรงไปตรงมาอย่างผิดปกติสำหรับอาร์ติแฟกต์จากผู้ขาย โดยระบุความล้มเหลวของตัวเองไว้ในฟีดประกาศ: การรีสตาร์ต Pro ที่สเต็ป 17 ซึ่งเกิดจากความผิดพลาด GPU หน่วยความจำไม่พอ (out-of-memory) จากความไม่สมดุลของภาระโหลดผู้เชี่ยวชาญ (expert load imbalance) ซึ่งทีมกล่าวว่าแก้ไขแล้วโดยปรับกลยุทธ์การทำขนานการฝึก (training parallelism strategy); ความผิดพลาดในการเชื่อมต่อเครือข่ายระหว่างคลัสเตอร์การฝึก Pro กับดีพลอยเมนต์สำหรับให้คะแนน (grading deployment) ซึ่งบังคับให้ต้องรีสตาร์ตและตัดสินใจตัดชุดข้อมูลไซเบอร์ (cyber dataset) ออกจากการรัน Pro ที่กำลังจะมาถึง หลังจาก "รูปแบบที่ไม่ดีในบันทึกการโรลเอาต์ (rollout logs)"; การรีสตาร์ต Flash จากสเต็ป 15 หลังจากข้อผิดพลาดด้านโครงสร้างพื้นฐานประเภทหนึ่งไม่ถูกตรวจพบเป็นเวลาประมาณสามชั่วโมง; และการรีสตาร์ต Pro จากความผิดพลาดของ VRAM บนโหนดเดียว นอกจากนี้ยังระบุว่างานที่ถูกประเมินว่า "ค่อนข้างง่ายสำหรับโมเดล pro ปัจจุบัน" ถูกกรองออก — เป็นการยอมรับที่รายงานหลังการฝึก (post-training reports) ส่วนใหญ่ไม่เอ่ยถึง

Screenshot of Xiaomi's public MiMo-V2.6 reinforcement-learning dashboard captured September 21, 2026. A total-cost counter reads $3,474,715, and a notices feed lists a Pro restart at step 17 from a GPU out-of-memory fault caused by expert load imbalance, a network connectivity fault between the Pro training cluster and the grader deployment, a Flash restart from step 15 after an infrastructure error went undetected for about three hours, a Pro restart from a node VRAM fault, and a note that tasks relatively easy for the current Pro model were filtered out. Two run cards show mimo-v2.6-pro stopped at step 30 — started 2026-09-15 10:32 UTC, stopped 2026-09-20, $2,620,670 spent, 75B tokens, 753k samples, batch 1,568 x 16 — and mimo-v2.6-flash stopped at step 30 — started 2026-09-15 15:16 UTC, stopped 2026-09-19, $854,044 spent, 81.4B tokens. Three benchmark panels read DeepSWE v1.1 mini-swe-agent avg@3: mimo-v2.6-pro 72.57, mimo-v2.6-flash 65.68; an in-house coding bench at 65.43 and 62.87; and AutomationBench v1.0.6 at 53.10 and 52.70.

การ์ดการรันทั้งสองใบคือส่วนที่สำคัญสำหรับใครก็ตามที่ติดตามเรื่องเวลา ทั้งสองโมเดลถูกระบุสถานะว่าหยุดแล้ว: MiMo-V2.6-Pro หลังผ่านไป 5 วัน 7 ชั่วโมงตามเวลาจริง และ MiMo-V2.6-Flash หลังผ่านไป 3 วัน 11 ชั่วโมง โดยแต่ละโมเดลอยู่ที่สเต็ป 30 เมื่อวันที่ 20 กันยายน และ 19 กันยายน ตามลำดับ Pro ใช้โทเคน 75B และตัวอย่าง 753k คิดเป็นค่าใช้จ่าย $2.62M ส่วน Flash ใช้โทเคน 81.4B คิดเป็น $854k แต่ละสเต็ปดึงแบตช์พรอมป์ต์ 1,568 รายการ โดยมี 16 โรลเอาต์ต่อพรอมป์ต์ — เท่ากับ 25,088 เส้นทางต่อสเต็ป รันแบบอะซิงโครนัสเต็มรูปแบบ

พูดให้ชัด ๆ เลย: Xiaomi ยังไม่ได้ระบุว่า "stopped" หมายถึงการรันเสร็จสิ้น หยุดชั่วคราว หรือถูกบันทึกเป็นเช็กพอยต์แล้ว การ์ดที่ขึ้นสถานะหยุดไม่ใช่ประกาศว่าเสร็จสมบูรณ์ และไม่มีใครนอกทีมรู้ว่ามันเป็นแบบไหน

สิ่งที่ได้รับการยืนยันแล้ว และสิ่งที่ยังไม่ได้รับการยืนยัน

72.57 ไม่ใช่ข่าวลือ มันถูกพิมพ์อยู่บนแดชบอร์ดของ Xiaomi ในแผนภูมิที่ระบุชื่อ DeepSWE v1.1, mini-swe-agent, avg@3 ข้างๆ เส้นโค้งสีส้มของการรัน Pro ค่า 65.68 ของโมเดล Flash อยู่บนแผนภูมิเดียวกัน ตัวเลขนี้ยังปรากฏ — ในรูป 62.24 และต่อมา 65.97 — ในสแนปช็อตก่อนหน้าของแผงเดียวกัน ซึ่งเป็นสิ่งที่ทำให้เส้นโค้งมีรูปร่างเช่นนี้: การไต่ขึ้นอย่างต่อเนื่องตลอด 30 ขั้นตอน มากกว่าการประเมินที่โชคดีเพียงครั้งเดียว

สิ่งที่เป็นเพียงการรายงานคือจุดเริ่มต้น ข้อกล่าวอ้างที่แพร่กระจายบน X เมื่อวันที่ 21 กันยายน จากบัญชี @nrehiew_ คือโมเดล Pro เพิ่มขึ้น “จาก 58.41 เป็น 72.57” บน DeepSWE และการรันเสร็จสิ้นแล้ว จุดปลายทางตรงกับแดชบอร์ดของผู้ขายอย่างแม่นยำ ค่าฐาน 58.41 เป็นการอ่านของบัญชีนั้นว่ากราฟเริ่มต้นตรงไหน — จุด Pro ซ้ายสุดของกราฟอยู่ในช่วงปลาย 50 จริง — และ Xiaomi ยังไม่ได้เผยแพร่ตัวเลขขั้นที่ 1 ข้ออ้างเรื่องการเสร็จสิ้นก็เช่นกันเป็นการตีความจากการ์ดสองใบที่ถูกทำเครื่องหมายว่าหยุด ซึ่งเป็นการอ่านที่สมเหตุสมผลและไม่ใช่ถ้อยแถลงของ Xiaomi ให้ถือว่าการปรับปรุง 14 จุดนั้นหนักแน่นในเชิงทิศทางและเป็นตัวเลขโดยประมาณ

A two-column scoreboard titled 'MiMo-V2.6-Pro vs the DeepSWE top tier', subtitled 'What Xiaomi published about its own checkpoint, against what the public leaderboard lists — September 21, 2026'. The left column, badged VENDOR-REPORTED and headed 'MiMo-V2.6-Pro', reads: DeepSWE v1.1 — 72.57; Basis — Xiaomi's own offline eval, mini-swe-agent avg@3; Confidence — not published; Cost per task — not published; Release — not announced; Independent runs — none. The right column, badged PUBLIC LEADERBOARD and headed 'Top tier — three-way tie', reads: DeepSWE v1.1 — 74%; Basis — submitted configs, Pass@1, GPT-6 Astra · Gemini 3.8 Flash · Claude Opus 5; Confidence — plus or minus 1 to 4 points; Cost per task — $2.36 to $11.84; Release — shipping today; Independent runs — on the public board. A footer reads 'MiMo-V2.6-Pro is Xiaomi's own offline evaluation, read from the vendor's public RL dashboard on 2026-09-21 and not submitted to the leaderboard. Top-tier figures per Datacurve's DeepSWE v1.1 leaderboard, updated 2026-09-03.' The OrcaRouter logo is composited in the bottom-right corner.

ยังมีความแตกต่างอีกหนึ่งอย่างที่การรายงานข่าวมองข้ามไป และมันคือสิ่งที่ชี้ว่าตัวเลขนี้มีค่าแค่ไหน แผงเบนช์มาร์กบนแดชบอร์ดเป็นการประเมินของ Xiaomi เอง บริษัทได้รัน harness บน checkpoint ของตัวเองและเผยแพร่ผลลัพธ์ออกมา harness ตัวนี้เป็นตัวเดียวกับที่ลีดเดอร์บอร์ดสาธารณะใช้ — mini-swe-agent, DeepSWE v1.1 — ซึ่งทำให้ตัวเลขนี้เปรียบเทียบกันได้มากกว่าที่เบนช์มาร์กที่ผู้ขายพัฒนาขึ้นเองจะทำได้ แต่การประเมินที่รันเองไม่ใช่รายการบนลีดเดอร์บอร์ด และ 72.57 ไม่ปรากฏบนบอร์ดของ Datacurve เพราะยังไม่มีใครส่งมันเข้าไป

เพดาน 74% แน่นกว่าที่พาดหัวข่าวบอกไว้

ซึ่งทำให้การเปรียบเทียบชัดเจนขึ้น ลีดเดอร์บอร์ด DeepSWE v1.1 ของ Datacurve ซึ่งอัปเดตล่าสุดเมื่อวันที่ 3 กันยายน 2026 ระบุ 113 งานจาก 91 รีพอซิทอรีในห้าภาษา และสามคอนฟิกูเรชันอันดับแรกของมันเสมอกันที่ 74% Pass@1: GPT-6 Astra ที่ความพยายามในการใช้เหตุผลระดับ xhigh, Gemini 3.8 Flash ที่ระดับ high และ Claude Opus 5 ที่ระดับ max ตัวเลขที่อยู่ข้าง ๆ คะแนนเหล่านั้นต่างหากที่น่าสนใจ

• ความมั่นใจ — GPT-6 Astra 74% ±3, Gemini 3.8 Flash 74% ±1, Claude Opus 5 74% ±4 บนกระดานเดียวกัน GPT-5.6 Sol อยู่ที่ 73% ±3 ส่วน GLM-5.3 และ Kimi K3 อยู่ที่ 69% ช่วงความเชื่อมั่นเหล่านี้ซ้อนทับกันเกินทศนิยมตำแหน่งที่สองไปไกล

• ต้นทุนต่องาน — Gemini 3.8 Flash เฉลี่ย $2.36, GPT-6 Astra $6.52, Claude Opus 5 $11.84 แผนภูมิของลีดเดอร์บอร์ดเองชี้ว่า Gemini 3.8 Flash เป็นการกำหนดค่าที่มีประสิทธิภาพสูงสุดบนบอร์ด และส่วนต่างระหว่างสามรุ่นนี้อยู่ที่ประมาณห้าต่อหนึ่งสำหรับอัตราการผ่านที่แบบทดสอบไม่สามารถแยกความแตกต่างได้

• ขั้นตอน — Gemini 3.8 Flash ต้องใช้ขั้นตอนของเอเจนต์โดยเฉลี่ย 166 ขั้นตอนต่องาน, Claude Opus 5 ใช้ 99, GPT-6 Astra ใช้ 29 คะแนนที่เสมอกันซ่อนรูปแบบการทำงานที่แตกต่างกันมากถึงสามแบบ และตัวที่ถูกที่สุดคือตัวที่ทำงานหนักที่สุด

Screenshot of Datacurve's DeepSWE v1.1 leaderboard captured September 21, 2026, showing 113 tasks, 91 repositories, five languages and 28 models, with the v1.1 and Best tabs selected and the board marked 'updated September 3, 2026'. The Pass@1 table lists gpt-6-astra (xhigh) at 74 percent plus or minus 3 with an average cost of $6.52, 30k output tokens and 29 steps; gemini-3.8-flash (high) at 74 percent plus or minus 1 at $2.36, 143k tokens and 166 steps; claude-opus-5 (max) at 74 percent plus or minus 4 at $11.84, 118k tokens and 99 steps; gpt-5.6-sol at 73 percent; claude-fable-5 at 70 percent; glm-5.3 and kimi-k3 at 69 percent; and grok-4.6 and gpt-5.6-luna at 67 percent. The score-versus-average-cost chart above the table labels gemini-3.8-flash as the most efficient configuration. No Xiaomi MiMo model appears on the board.

ดังนั้น เมื่อ 72.57 ที่รายงานถูกอธิบายว่า "เข้าใกล้จุดสูงสุดของกระดาน" เวอร์ชันที่แม่นยำกว่านั้นแคบกว่าและไม่หวือหวาเท่า มันห่างจากกลุ่มที่เสมอกันสามทางประมาณหนึ่งจุดครึ่ง ซึ่งสมาชิกของกลุ่มไม่สามารถแยกออกจากกันได้ด้วยแถบข้อผิดพลาดของเบนช์มาร์กเอง มันเป็นผลลัพธ์ที่แข็งแกร่งสำหรับโมเดลที่ยังอยู่ในช่วงหลังการฝึก ซึ่งผลิตโดยผู้ขาย ไม่ใช่ผู้ดูแลเบนช์มาร์ก บนกระดานที่โมเดลยังไม่ได้ถูกส่งเข้าร่วม การอัปเดตล่าสุดของลีดเดอร์บอร์ดเกิดขึ้นก่อนการรันของ Xiaomi ทั้งหมด ซึ่งเป็นเหตุผลว่าทำไมจึงยังไม่มี MiMo ปรากฏอยู่บนนั้น

ทำไม Xiaomi จึงฝึกแบบเปิดเผย

ความโปร่งใสนี้ไม่ได้เกิดขึ้นโดยบังเอิญ การเปิดตัวโมเดลแบบเปิดน้ำหนักครั้งล่าสุดของ Xiaomi คือ Xiaomi MiMo-V2.5 และ Xiaomi MiMo-V2.5-Pro เมื่อปลายเดือนเมษายน ทั้งคู่อยู่ภายใต้สัญญาอนุญาต MIT — ใช้ในเชิงพาณิชย์ได้ ปรับแต่งละเอียดได้ และแจกจ่ายซ้ำได้ MiMo-V2.5-Pro เป็นโมเดล mixture-of-experts ขนาด 1.02 ล้านล้านพารามิเตอร์ ที่มีพารามิเตอร์ที่ใช้งานจริง 42B สถาปัตยกรรมแบบ hybrid-attention และหน้าต่างบริบท 1M โทเคน และสื่อเปิดตัวของมันได้ระบุข้ออ้างด้าน agentic อย่างชัดเจน: คอมไพเลอร์ที่เขียนขึ้นใหม่ตั้งแต่ต้นด้วย Rust ผ่านการเรียกใช้เครื่องมือหลายร้อยครั้ง แอปพลิเคชันเดสก์ท็อปแปดพันบรรทัดที่สร้างขึ้นภายในเวลาสิบเอ็ดชั่วโมงของการทำงานของเอเจนต์

การสตรีมโพสต์เทรนนิงของรุ่นถัดไปเป็นคำกล่าวอ้างอีกแบบหนึ่ง ห้องแล็บที่เผยแพร่เส้นโค้งรางวัล จำนวนแซนด์บ็อกซ์ และข้อขัดข้องของ GPU แบบเรียลไทม์ กำลังขอให้ถูกตัดสินจากกระบวนการ มากกว่าชุดสไลด์เปิดตัว และกำลังส่งสัญญาณไทม์ไลน์ Luo Fuli กล่าวว่า รายละเอียดทางเทคนิคของงาน RL จะถูกโอเพนซอร์สทีละส่วนในอีกไม่กี่สัปดาห์ข้างหน้า นั่นคือสิ่งที่ใกล้เคียงกับกำหนดการมากที่สุดเท่าที่มีใครเสนอมา: วิธีการก่อน โมเดลทีหลัง

นอกจากนี้ยังสอดคล้องกับรูปแบบที่ Xiaomi เคยใช้มาก่อน โดยที่โมเดลหนึ่งจะปรากฏต่อสาธารณะภายใต้ชื่ออื่นก่อนที่บริษัทจะออกมาประกาศว่าเป็นของตน นิสัยของบริษัทคือการฝึกอย่างเงียบ ๆ ทดสอบอย่างเปิดเผย แล้วจึงปล่อยพร้อมน้ำหนักโมเดล

สิ่งที่คุณสามารถรันได้ในวันนี้

ไม่มีอะไรในตระกูล MiMo-V2.6 หากคุณต้องการโมเดล Xiaomi MiMo ในตอนนี้ สิ่งที่มีอยู่คือรุ่น V2.5 — น้ำหนักแบบเปิดผ่านช่องทางของ Xiaomi เองและแพลตฟอร์มบุคคลที่สามหลายแห่ง พร้อมการ์ดและราคาที่เผยแพร่แล้ว ไม่มี API ของ MiMo-V2.6 ไม่มีตัวระบุโมเดล และไม่มีรายการราคา และหน้าใดก็ตามที่อ้างตัวระบุ MiMo-V2.6 หรืออัตราต่อโทเคน กำลังเติมช่องว่างที่ Xiaomi ปล่อยว่างไว้ สตริง `mimo-v2.6-pro` และ `mimo-v2.6-flash` บนแดชบอร์ดเป็นชื่อของงานฝึกโมเดล ไม่ใช่ปลายทางที่เผยแพร่แล้ว

ผลลัพธ์ในทางปฏิบัติอีกประการหนึ่งก็คือ ระหว่างนี้ควรทำอย่างไร หากเหตุผลที่ MiMo-V2.6-Pro น่าสนใจสำหรับคุณคือมันอาจเป็นวิธีที่ถูกกว่าในการไปถึงประสิทธิภาพการเขียนโค้ดระดับแนวหน้า บรรดาคอนฟิกูเรชันที่มันถูกนำมาเปรียบเทียบด้วยนั้นเรียกใช้ได้อยู่แล้ว และลีดเดอร์บอร์ดก็บอกว่าตัวที่ถูกกว่านั้นแข่งขันได้: Gemini 3.8 Flash ทำอัตราการผ่านสูงสุดได้เท่ากันที่ $2.36 ต่องาน และถูกระบุว่าเป็นคอนฟิกูเรชันที่มีประสิทธิภาพสูงสุดของบอร์ด Gemini 3.8 Flash, Claude Opus 5 และ GPT-6 Astra ล้วนเข้าถึงได้ผ่านคีย์ API เดียวของ OrcaRouter ในราคาตามที่ผู้ให้บริการประกาศ โดยไม่บวกเพิ่ม 0% — ดังนั้นการเปลี่ยนแปลงราคาของผู้ขายจึงมีผลจริงฝั่งเราภายในวันเดียวกัน แทนที่จะรอรอบบิลถัดไป — โดยมีการตั้งค่า failover แยกตามโมเดลแทนที่จะแยกตามผู้ขาย และเมื่อห้องแล็บใดเปิดโมเดลแบบนี้จริง การกำหนดเส้นทางให้มันอยู่หลังคีย์เดียวกันคือวิธีประเมินมันแบบที่ผูกมัดน้อย: คุณสามารถนำมันมารองรับทราฟฟิกจริงได้โดยไม่ต้องเดิมพันเส้นทางโปรดักชันกับเช็กพอยต์ที่ยังไม่มีใครจำแนกลักษณะไว้

อะไรที่จะเปลี่ยนเรื่องนี้ได้จริง ๆ

สัญญาณสี่อย่าง เรียงตามลำดับโดยประมาณว่าสิ่งใดจะช่วยชี้ขาดได้มากน้อยเพียงใด:

• น้ำหนักโมเดลบน Hugging Face ภายใต้สัญญาอนุญาตที่ระบุไว้ ซึ่งเป็นวิธีที่รุ่น V2.5 เปิดตัว และเป็นหลักฐานที่ชัดเจนที่สุดว่าการรัน RL ให้ผลเป็นโมเดลที่พร้อมนำออกใช้จริง มากกว่าจะเป็นการทดลองที่สิ้นสุดลงเพียงเท่านั้น

• การ์ดโมเดลที่ระบุจำนวนพารามิเตอร์ ความยาวคอนเท็กซ์ และสถาปัตยกรรม — ตัวเลขของ V2.6 ไม่มีตัวใดเปิดเผยต่อสาธารณะ และแดชบอร์ดก็ไม่ได้แสดงตัวเลขเหล่านั้น การสมมติว่า V2.6-Pro สืบทอดโครงสร้าง 1.02T/42B ของ V2.5-Pro ถือเป็นการคาดเดา

• ตัวระบุ API และตารางราคา ซึ่งเป็นจุดที่ตัวเลขของ DeepSWE กลายเป็นการตัดสินใจซื้อ มิใช่แค่กีฬาที่นั่งดูอยู่ห่าง ๆ

• การส่งผลงานไปยังบอร์ด DeepSWE ของ Datacurve ซึ่งจะทำให้ MiMo-V2.6-Pro อยู่บนตารางเดียวกันและภายใต้แถบความคลาดเคลื่อนเดียวกันกับโมเดลที่กำลังถูกนำมาเปรียบเทียบด้วย การประเมินที่ผู้ขายเป็นผู้ดำเนินการกับการส่งเข้าลีดเดอร์บอร์ดไม่ใช่คำกล่าวอ้างเดียวกัน และช่องว่างระหว่างทั้งสองก็คือหนึ่งแถวของตารางนั้นพอดี

จนถึงตอนนั้น สรุปอย่างตรงไปตรงมาก็คือ เสียวหมี่ได้แสดงให้เห็นการรันหลังการฝึก (post-training run) ที่โปร่งใสที่สุดเท่าที่ห้องแล็บชั้นนำใดๆ เคยเผยแพร่ บนโมเดลสองตัวที่ยังไม่ได้เปิดตัว โดยมีคะแนน benchmark ที่รายงานเองหนึ่งค่า ซึ่งเข้าใกล้ — แต่ไม่ได้ติด — อันดับต้นๆ ของตารางจัดอันดับ เอกสารอธิบายระเบียบวิธีได้รับการสัญญาว่าจะมาในอีกไม่กี่สัปดาห์ข้างหน้า ส่วนวันเปิดตัวนั้นไม่ได้ให้สัญญาไว้เลย

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube