
MiMo-V2.6-Pro vs Grok 4.6: ทั้งสองเจ้าเผยตัวเลข DeepSWE ออกมา และไม่มีเจ้าไหนติดกระดานอันดับเลย
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
ผู้ขายสองราย หนึ่งเบนช์มาร์ก สองตัวเลขที่นำมาลบกันไม่ได้ เอกสารเปิดตัวของ SpaceXAI สำหรับ Grok 4.6 รายงาน 65.9% บน DeepSWE v1.1 เอกสารของ Xiaomi สำหรับ MiMo-V2.6-Pro รายงาน 72.57 บน DeepSWE v1.1 เมื่ออ่านรวมกัน พวกมันชี้ว่าโมเดลน้ำหนักเปิดที่ถูกกว่าเอาชนะโมเดลแบบกรรมสิทธิ์ระดับแนวหน้าได้เกือบเจ็ดจุด พออ่านอย่างละเอียดกลับแทบไม่ได้บอกอะไรเลย เพราะตัวหนึ่งเป็นเปอร์เซ็นต์จากสไลด์เปิดตัวบนฮาร์เนสของผู้ขายเอง และอีกตัวเป็นค่าเฉลี่ยจากการรันสามครั้งในงานเรียนรู้แบบเสริมกำลังบนตัวให้คะแนนของ Xiaomi เอง และไม่มีตัวไหนถูกส่งไปยังกระดาน DeepSWE สาธารณะ การเปรียบเทียบระหว่าง MiMo-V2.6-Pro กับ Grok 4.6 ที่ยังยืนได้เมื่อถูกตรวจสอบอย่างละเอียดนั้นอยู่บนดัชนีอิสระ และตรงนั้นคำตอบกลับตรงข้ามกับตัวเลขของผู้ขาย: 46 ต่อ 44 เป็นผลดีต่อ Xiaomi ด้วยส่วนต่างสองจุด
Grok 4.6 เปิดตัวเมื่อวันที่ 12 สิงหาคม 2026 โดย SpaceXAI และเป็นผู้ครองตลาดในที่นี้ — โมเดลแนวหน้าที่เปิดให้บริการอย่างแพร่หลาย มีรายการราคาที่จัดทำเป็นเอกสาร และผ่านการวัดผลอย่างอิสระมาหลายเดือน Xiaomi MiMo-V2.6-Pro เปิดให้บริการทั่วไปเมื่อวันที่ 22 กันยายน 2026 โดยที่คลังเก็บเช็คพอยต์ด้านการเรียนรู้แบบเสริมกำลังปรากฏขึ้นเมื่อวันก่อน และมันคือผู้มาใหม่ ทั้งสองมีความสามารถในการให้เหตุผล ทั้งสองถูกสร้างขึ้นสำหรับงานเอเจนต์ที่ทำงานเป็นเวลานาน และช่องว่างราคาระหว่างทั้งสองกว้างพอที่ความไม่มีประสบการณ์ของผู้มาใหม่จะเป็นเพียงสิ่งเดียวที่ฉุดรั้งการเปรียบเทียบไว้
แต่ละโมเดลจริงๆ แล้วคืออะไร
Grok 4.6 เป็นซอฟต์แวร์ปิด รับอินพุตเป็นข้อความและรูปภาพ แล้วส่งคืนข้อความ และมีวันตัดขอบเขตความรู้คือวันที่ 1 กุมภาพันธ์ 2026 หน้าต่างบริบทของมันมีขนาด 500,000 โทเคน ซึ่งเป็นครึ่งหนึ่งของขนาดของคู่แข่งหลัก และเป็นสเปกที่ส่งผลตามมามากที่สุดเพียงรายการเดียวในเอกสารข้อมูลจำเพาะของมัน อัตราตามประกาศของมันคือ $2.00 ต่ออินพุตหนึ่งล้านโทเคน, $0.50 ต่ออินพุตที่แคชไว้หนึ่งล้านโทเคน และ $6.00 ต่อเอาต์พุตหนึ่งล้านโทเคน เมื่อพรอมป์ตต่ำกว่า 200,000 โทเคน โดยมีจุดเปลี่ยนแบบหน้าผาที่ขอบเขตนั้น: ที่ 200K หรือสูงกว่า อัตราจะกลายเป็น $4.00, $1.00 และ $12.00 และระดับราคาที่สูงกว่าจะคิดค่าบริการทั้งคำขอแทนที่จะคิดเฉพาะส่วนที่เกินเส้น การประมวลผลแบบลำดับความสำคัญคิดเป็นสองเท่าของอัตรามาตรฐาน Artificial Analysis วัดได้ 63.0 เอาต์พุตโทเคนต่อวินาที และ 42.79 วินาทีถึงโทเคนแรกที่ความพยายามสูงสุด และ $2,351.83 สำหรับการรันดัชนีทั้งหมด
Xiaomi MiMo-V2.6-Pro เป็นโมเดลแบบผสมผู้เชี่ยวชาญแบบเบาบางที่มีพารามิเตอร์ทั้งหมด 1.02 ล้านล้าน และเปิดใช้งาน 42 พันล้านต่อโทเค็น มีหน้าต่างบริบท 1M โทเค็น และรองรับหลายรูปแบบโดยกำเนิดทั้งข้อความ รูปภาพ วิดีโอ และเสียง ได้รับสัญญาอนุญาต MIT พร้อมน้ำหนักที่ดาวน์โหลดได้ และ Xiaomi คงราคาของรุ่นก่อนไว้แทนที่จะปรับราคาเช็คพอยต์ใหม่ให้สูงขึ้น — $0.43 ต่อล้านโทเค็นอินพุต และ $0.87 ต่อล้านโทเค็นเอาต์พุต ส่วนลดแคช 99% และราคาเฉลี่ย $0.18 ที่อัตราส่วนการชนแคช/อินพุต/เอาต์พุต 7:2:1 Artificial Analysis วัดได้ 134.3 โทเค็นเอาต์พุตต่อวินาที 2.15 วินาทีถึงโทเค็นแรก และ $206.66 ในการรันดัชนี — $0.13 ต่องาน
• ค่าน้ำหนัก — MiMo-V2.6-Pro ใช้สัญญาอนุญาต MIT และดาวน์โหลดได้; Grok 4.6 เป็นกรรมสิทธิ์ ใช้ผ่าน API เท่านั้น
• พารามิเตอร์ — MiMo-V2.6-Pro 1.02T รวมทั้งหมด / 42B ที่เปิดใช้งาน; Grok 4.6 ไม่เปิดเผย
• บริบท — MiMo-V2.6-Pro 1M โทเคน; Grok 4.6 500K โดยมีจุดที่ราคาพุ่งขึ้นแบบหน้าผาเมื่ออินพุตถึง 200K
• โมดัลลิตี — MiMo-V2.6-Pro รองรับข้อความ รูปภาพ วิดีโอ และเสียง ส่วนอินพุตที่เผยแพร่ของ Grok 4.6 ได้แก่ข้อความและรูปภาพ
• คะแนนดัชนี — MiMo-V2.6-Pro 46; Grok 4.6 44 ทั้งคู่มาจาก Artificial Analysis v4.3.2
• ราคาตามรายการ — MiMo-V2.6-Pro $0.43 / $0.87 ต่อ 1M; Grok 4.6 $2.00 / $6.00 โดยเพิ่มเป็นสองเท่าเมื่ออินพุตเกิน 200K
• อัตราแบบผสม — MiMo-V2.6-Pro $0.18 ต่อ 1M; Grok 4.6 $1.35
• ค่าใช้จ่ายในการรันดัชนี — MiMo-V2.6-Pro $206.66; Grok 4.6 $2,351.83
• ความเร็ว — MiMo-V2.6-Pro 134.3 โทเค็นเอาต์พุต/วินาที; Grok 4.6 63.0
• เวลาถึงโทเคนแรก — MiMo-V2.6-Pro 2.15 วินาที; Grok 4.6 42.79 วินาที
• จุดตัดความรู้ — MiMo-V2.6-Pro ยังไม่เผยแพร่; Grok 4.6 1 กุมภาพันธ์ 2026

เบนช์มาร์กที่ทั้งสองผู้ขายรัน และเหตุใดจึงนำมาเปรียบเทียบกันไม่ได้
DeepSWE v1.1 เป็นการประเมินเอเจนต์เขียนโค้ดโดยบุคคลที่สามที่เป็นสาธารณะและมีอยู่จริง ดำเนินการโดย Datacurve และเป็นตระกูลงานเดียวที่ทั้งสองบริษัทเลือกเผยแพร่ผลด้วยกัน สิ่งนี้จึงชวนให้อยากนำมาใช้但它ไม่ควรถูกใช้เป็นการเปรียบเทียบแบบตัวต่อตัว และเหตุผลไม่ใช่ว่าผู้ขายรายใดโกหก — แต่เป็นเพราะตัวเลขทั้งสองนั้นอธิบายการวัดที่แตกต่างกันของชื่องานเดียวกัน
72.57 ของ Xiaomi เป็นค่าเฉลี่ยจากการรันสามครั้งบนฮาร์เนสของตัวเองโดยใช้ mini-swe-agent ซึ่งได้มาระหว่างการรัน reinforcement learning ไม่ใช่จาก release candidate ที่ freeze ไว้ และรายงานคู่กับตัวเลขเริ่มต้นที่ 58.4 การรันนี้ได้รับการบันทึกว่าใช้ 30 steps และมีประมาณ 750,000 trajectories ต่อโมเดล เสร็จสิ้นภายในเวลาไม่ถึงหกวัน ด้วยค่าใช้จ่ายที่เปิดเผยประมาณ 2.62 ล้านดอลลาร์สำหรับโมเดล Pro ยังไม่ถูกส่งไปยังบอร์ดของ Datacurve ตัวเลข 65.9% ของ SpaceXAI สำหรับ Grok 4.6 เป็นตัวเลขบนสไลด์เปิดตัว ซึ่งมาจากชุดประเมินของทางผู้ขายเอง รายงานควบคู่กับส่วนที่เพิ่มขึ้นจาก Grok 4.5 จำนวน 11.9 คะแนนบน benchmark เดียวกัน — และบอร์ดสาธารณะมีคอนฟิกูเรชัน Grok 4.6 ที่ถูกส่งแล้วอยู่ที่ประมาณ 67% ซึ่งใกล้เคียงกับตัวเลขของผู้ขายมากพอที่จะบ่งชี้ว่าฮาร์เนสอย่างน้อยก็สอดคล้องกันโดยประมาณ สิ่งนี้ไม่เป็นจริงกับตัวเลขของ Xiaomi ซึ่งไม่มีคู่เทียบสาธารณะเลยแม้แต่รายการเดียว
ดังนั้นคำกล่าวที่ตรงไปตรงมาก็คือ: บนบอร์ดสาธารณะ Grok 4.6 ปรากฏอยู่ และ MiMo-V2.6-Pro ไม่ปรากฏอยู่ บนดัชนีรวมอิสระ ทั้งคู่ถูกนำมาทดสอบกับมันจริงโดยผู้ประเมินรายเดียวกัน โมเดลของ Xiaomi นำอยู่สองคะแนน ข้อเท็จจริงสองข้อนั้นไม่ได้ขัดแย้งกัน พวกมันเพียงวัดคนละสิ่ง และข้อที่สองคือข้อที่ควรนำไปอ้าง
คอนเท็กซ์ 500K คือสเปกที่ตัดสินว่าเวิร์กโหลดจริงเป็นอย่างไร
ครึ่งล้านโทเคนถือเป็นหน้าต่างบริบทขนาดใหญ่ตามมาตรฐานปกติใด ๆ และถือว่าเล็กสำหรับปี 2026 โมเดลที่ MiMo-V2.6-Pro ถูกจัดกลุ่มอยู่ด้วยนั้นล้วนอยู่ที่ 1M และผลลัพธ์ในทางปฏิบัติจะปรากฏชัดในเวิร์กโหลดที่ Grok 4.6 ถูกทำการตลาดรองรับพอดี เอเจนต์เขียนโค้ดที่ทำงานยาวนานซึ่งถือที่เก็บโค้ด บันทึกการใช้งานเครื่องมือ และแผนที่สะสมไว้ จะข้าม 200,000 โทเคนของพรอมป์ต์ในเซสชันเดียว และเมื่อถึงเส้นนั้น อัตราของ Grok 4.6 จะเพิ่มเป็นสองเท่าและมีผลย้อนหลังกับทั้งคำขอ เซสชันเดียวกันบน MiMo-V2.6-Pro ทำงานไปถึงหนึ่งล้านโทเคนโดยไม่มีการเปลี่ยนระดับชั้น
นั่นคือความแตกต่างด้านสเปกและความแตกต่างด้านโครงสร้างราคาในเวลาเดียวกัน และอย่างหลังนั้นมองข้ามได้ง่ายเมื่อเทียบอัตราราคาที่ประกาศ อัตราเฉลี่ยแบบผสม $1.35 สำหรับ Grok 4.6 เทียบกับ $0.18 สำหรับ MiMo-V2.6-Pro เป็นช่องว่าง 7.5 เท่า สำหรับพรอมต์ที่เกิน 200K ช่องว่างจะกว้างขึ้นจนใกล้ 15 เท่า เพราะอัตราของ Grok เพิ่มเป็นสองเท่า ส่วนของ Xiaomi ไม่ขยับ
ข้อโต้แย้งอีกด้านก็ถูกบันทึกไว้เช่นกัน และมันก็สมควรที่จะเป็นเช่นนั้น แนวคิดหลักในการเปิดตัวของ Grok 4.6 คือประสิทธิภาพด้านจำนวนรอบมากกว่าบริบทดิบ: ในการประเมินแบบเอเจนต์ติกซึ่งวัดเทียบกับ Claude Opus 5 บนงานเดียวกัน มันทำงานเสร็จในประมาณ 53 รอบ และใช้โทเค็นอินพุตประมาณ 500 ล้านโทเค็น เทียบกับประมาณ 103 รอบ และสองพันล้านโทเค็นของโมเดลอีกตัว โดยมีค่าประมาณ $0.84 ต่องาน ซึ่งเป็นตัวเลขที่ต่ำที่สุดในบรรดาโมเดลระดับแนวหน้าในการเปรียบเทียบนั้น โมเดลที่วนลูปเพียงครึ่งหนึ่งของจำนวนรอบไม่จำเป็นต้องใช้บริบทมากเท่า และไม่เผาโทเค็นมากเท่า นั่นคือข้อได้เปรียบเชิงสถาปัตยกรรมที่แท้จริง และเป็นข้อโต้แย้งที่แข็งแกร่งที่สุดสำหรับ Grok 4.6 ต่อทางเลือกที่ราคาต่อโทเค็นถูกกว่าใด ๆ รวมถึงทางเลือกนี้ด้วย

การไปถึงแต่ละแห่ง
Grok 4.6 อยู่บน OrcaRouter ในชื่อ grok/grok-4.6 ซึ่งเข้าถึงได้ผ่าน endpoint เดียวที่รองรับ OpenAI-compatible ในราคาตามที่ผู้ให้บริการระบุ โดยไม่มีการบวกเพิ่ม 0% — ดังนั้นหาก SpaceXAI เปลี่ยนราคา รวมถึงการเปลี่ยนแปลงที่จุด 200K นั้น ฝั่งเราจะอัปเดตให้ภายในวันเดียวกัน Xiaomi MiMo-V2.6-Pro ไม่ได้อยู่บน OrcaRouter ไม่มีโมเดล Xiaomi ใดอยู่บนนี้เลย และเส้นทางไปยังโมเดลนี้ในตอนนี้คือแพลตฟอร์มของ Xiaomi เองหรือแค็ตตาล็อกของบุคคลที่สามที่ระบุโมเดลนี้ไว้ การพูดแบบตรงไปตรงมาแบบนี้มีประโยชน์กว่าการปล่อยให้หน้ารายละเอียดโมเดลสื่อเป็นนัยเป็นอย่างอื่น
สิ่งที่ความไม่สมดุลนั้นมีค่าในทางปฏิบัติก็คือการทดลองที่ราคาถูก Grok 4.6 คือโมเดลที่คุณอาจกำลังจ่ายเงินอยู่แล้ว MiMo-V2.6-Pro คือการปรับปรุงดัชนีสองจุดในอัตราที่เป็นเศษเสี้ยว เปิดตัวสัปดาห์นี้ โดยมีเส้นทางให้บริการเพียงเส้นทางเดียวรองรับอยู่ คำถามที่คุ้มค่าที่จะตอบไม่ใช่ว่าตัวไหนดีกว่าในเชิงนามธรรม แต่คือปริมาณทราฟฟิก Grok ของคุณที่โมเดลของ Xiaomi สามารถรับได้บนพรอมป์ต์ของคุณเอง — และการตอบคำถามนั้นด้วยการเปิดสัญญาที่สอง คีย์ที่สอง และความสัมพันธ์ด้านการเรียกเก็บเงินที่สอง คือแรงเสียดทานที่ทำให้การทดสอบไม่เกิดขึ้น ด้วยปลายทางเดียวและการสลับสำรองอัตโนมัติข้ามผู้ให้บริการ การเปรียบเทียบจึงเป็นเพียงการเปลี่ยนคอนฟิก และครึ่งหนึ่งที่เกี่ยวกับการสลับสำรองสำคัญกว่าปกติในกรณีนี้: โมเดลที่เพิ่งเปิดตัวสัปดาห์นี้และถูกจัดอยู่ในรายการโดยผู้ให้บริการ API รายเดียวตอนที่ Artificial Analysis จับข้อมูลได้ ไม่ใช่สิ่งที่ควรนำไปใส่ในเส้นทางโปรดักชันโดยไม่มีช่องทางให้ถอยกลับ

ควรเลือกอันไหนดี
เลือก Grok 4.6 เมื่อประสิทธิภาพต่อเทิร์นคือสิ่งที่คุณกำลังปรับให้เหมาะสม — ลูปของเอเจนต์ที่ยาวนาน ซึ่งความสามารถของโมเดลในการทำงานให้เสร็จในจำนวนขั้นเพียงครึ่งเดียวมีค่ามากกว่าอัตราค่าบริการต่อโทเคน — หรือเมื่อคุณต้องการโมเดลที่มีการวัดผลอย่างอิสระหลายเดือนรองรับ มากกว่าเพียงหนึ่งสัปดาห์ อัตรา 63 โทเคนต่อวินาที และเวลา 42.79 วินาทีถึงโทเคนแรก ทำให้มันเป็นโมเดลสำหรับงานแบบแบตช์และงานเวิร์กโหลดออฟไลน์ในเชิงการโต้ตอบ และคอนเท็กซ์ 500K ที่มีกำแพงราคาที่ 200K เป็นเหตุผลให้ควรทำให้พรอมป์ตสั้นเข้าไว้
เลือก MiMo-V2.6-Pro เมื่อคุณต้องรันลูปแบบซ้ำ ๆ ที่ใช้บริบทหนัก ซึ่งจะข้ามเส้นตาย 200K ของ Grok เมื่อคุณต้องการความหน่วงของโทเคนแรกที่ต่ำพอให้มนุษย์รอไหว เมื่อคุณต้องการเก็บเวตไว้ในโครงสร้างพื้นฐานของคุณเอง หรือเมื่อปริมาณงานทำให้ช่องว่างอัตราคิดค่าบริการแบบผสมที่ต่างกัน 7.5 เท่าเป็นตัวเลขที่ชี้ขาด การที่มันนำอยู่สองจุดในดัชนีนั้นน้อยพอที่ไม่ควรเป็นเหตุผลในตัวเอง ส่วนค่าใช้จ่าย 206.66 ดอลลาร์ เทียบกับ 2,351.83 ดอลลาร์ในการรันชุดการประเมินเดียวกันต่างหากที่เป็นเหตุผลที่ดีกว่า
สิ่งที่ทำให้คำถามที่ยังเปิดอยู่ได้ข้อยุติ คือคอนฟิกูเรชัน DeepSWE ที่ส่งเข้ามาสำหรับ MiMo-V2.6-Pro Grok 4.6 มีอยู่แล้วหนึ่งรายการ ทันทีที่โมเดลของ Xiaomi ปรากฏบนกระดานสาธารณะพร้อมฮาร์เนสที่ระบุไว้ ช่วงความเชื่อมั่น และค่าใช้จ่ายต่องาน 72.57 ก็จะเลิกเป็นตัวเลขจากผู้ขาย และการเปรียบเทียบข้างต้นก็จะกลายเป็นการเปรียบเทียบจริง — และเมื่อพิจารณาช่องว่างสองจุดบนดัชนี ผลลัพธ์อาจเป็นไปได้ทั้งสองทาง
OrcaRouter นำโมเดล 200+ รายการมาไว้ใน endpoint เดียวที่เข้ากันได้กับ OpenAI ในราคาตามรายการของผู้ให้บริการ โดยมีส่วนบวกเพิ่ม 0% ดังนั้นการเปลี่ยนแปลงราคาของผู้ขายจะมีผลในวันเดียวกัน
การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
