
Xiaomi MiMo-V2.6-Pro vs Grok 4.7: ถูกกว่าต่องาน 30 เท่า และทั้งคู่ก็ไม่เร็ว
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 36 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 181 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
เสี่ยวมี่ MiMo-V2.6-Pro และ Grok 4.7 เปิดตัวเมื่อวันที่ 21 กันยายน 2026 ทั้งคู่ได้ 46 คะแนนบน Artificial Analysis Intelligence Index v4.3.2 และทั้งคู่ถูกหน้าเว็บที่วัดพวกมันเรียกว่าช้า — 43.6 โทเคนเอาต์พุตต่อวินาทีสำหรับ MiMo-V2.6-Pro เทียบกับค่ามัธยฐาน 67.1, 40 สำหรับ Grok 4.7 ที่ระดับความพยายาม xhigh สิ่งที่ทำให้ทั้งสองต่างกันคือค่าใช้จ่ายของคำตอบหนึ่งคำตอบ ตัวเลขต่องานของผู้ประเมินคือ $0.13 สำหรับเช็กพอยต์แบบเปิดของจีน และ $3.74 สำหรับโมเดล Grok 4.7 คิดเป็นราว 29 เท่า นั่นไม่ใช่ความแตกต่างของอัตรา หรือไม่ใช่แค่ความแตกต่างของอัตราเพียงอย่างเดียว: อัตราเอาต์พุตของ Grok 4.7 อยู่ที่ $6.00 ต่อล้านโทเคน เทียบกับ $0.87 ซึ่งเป็นเจ็ดเท่า และส่วนที่เหลือของตัวคูณนั้นมาจากจำนวนโทเคนที่แต่ละโมเดลใช้ไปเพื่อไปให้ถึงคำตอบ
สองโมเดลในเดือนเดียวกัน บนดัชนีเดียวกัน ด้วยคะแนนเดียวกัน แต่ตั้งราคาราวกับว่าอยู่กันคนละทศวรรษของตลาด คำถามที่น่าสนใจไม่ใช่ว่าตัวไหนชนะ แต่คือส่วนไหนของ 29× นั้นที่คุณจะหาเส้นทางอ้อมไปได้จริง ๆ — เพราะในคู่นี้ มีเพียงหนึ่งในสองเท่านั้นที่เป็นเส้นทางที่คุณซื้อได้วันนี้ และมันคือตัวที่แพง
วันเดียวกัน คะแนนเดียวกัน สัตว์ต่างกัน
Grok 4.7 เปิดตัวเมื่อวันที่ 21 กันยายน 2026 ในราคา 2.00 ดอลลาร์ต่อล้านโทเค็นอินพุต และ 6.00 ดอลลาร์ต่อล้านโทเค็นเอาต์พุต พร้อมหน้าต่างบริบท 500,000 โทเค็น, จุดตัดความรู้เดือนพฤษภาคม 2026, ส่วนลดแคช 75% และรองรับอินพุตทั้งข้อความและรูปภาพโดยให้เอาต์พุตเป็นข้อความ มันทำคะแนนได้ 46 บนดัชนีที่ระดับความพยายาม xhigh, 56 บน Coding Agent Index ในฮาร์เนส Grok Build และ 1,657 Elo บน AA-Briefcase — เป็นอันดับที่สี่บนกระดานนั้น เป็นรองสามรายการจาก Anthropic ด้วยต้นทุนต่องานประมาณครึ่งหนึ่งของ Claude Opus 5
Xiaomi MiMo-V2.6-Pro เป็นเช็กพอยต์แบบ sparse mixture-of-experts มีพารามิเตอร์รวม 1.02 ล้านล้านตัว โดยมีพารามิเตอร์ที่ใช้งานจริง 4.2 หมื่นล้านตัว ได้รับสัญญาอนุญาตแบบ MIT รองรับบริบทขนาด 1M โทเคน มีอินพุตเป็นข้อความ รูปภาพ เสียงพูด และวิดีโอ โดยมีเอาต์พุตเป็นข้อความ ราคา $0.43 และ $0.87 ต่อล้านโทเคน พร้อมส่วนลดแคช 99% ซึ่งทำให้อัตราอินพุตที่มีผลจริงลดลงจนแทบไม่มีเลยเมื่อพรอมป์อยู่ในสถานะอุ่น Artificial Analysis จัดอันดับให้อยู่ที่หนึ่งจาก 114 โมเดลแบบเปิดน้ำหนักบนดัชนี และที่สิบสองจาก 114 ด้านต้นทุน สามารถเข้าถึงได้ผ่านผู้ให้บริการ API สามราย โมเดลนี้ยังไม่อยู่ในเส้นทางของเรา และเราไม่แสดงรายการโมเดลก่อนที่ผู้ให้บริการจะรับโมเดลนั้นเข้าสู่ระบบ
บรรทัดเดียวที่ชี้ขาด
• ค่าใช้จ่ายต่องานจัดทำดัชนี — MiMo-V2.6-Pro $0.13; Grok 4.7 $3.74 — 29 เท่า • อัตราค่าเอาต์พุต — MiMo-V2.6-Pro $0.87 / 1M; Grok 4.7 $6.00 / 1M — 6.9 เท่า • จำนวนโทเคนเอาต์พุตในรอบรันจัดทำดัชนี — MiMo-V2.6-Pro 140M; Grok 4.7 240M เทียบกับค่ามัธยฐานที่ 88M • ความเร็วเอาต์พุต — MiMo-V2.6-Pro 43.6 t/s; Grok 4.7 40 t/s — ทั้งคู่ต่ำกว่าค่ามัธยฐาน • หน้าต่างบริบท — MiMo-V2.6-Pro 1M; Grok 4.7 500K • น้ำหนักโมเดล — MiMo-V2.6-Pro ได้รับสัญญาอนุญาต MIT และดาวน์โหลดได้; Grok 4.7 เป็นซอฟต์แวร์กรรมสิทธิ์ ใช้ผ่าน API เท่านั้น
อ่านสองหัวข้อย่อยแรกประกอบกัน แล้วรูปแบบของช่องว่างจะชัดเจนขึ้น ที่ราคาตั้ง ทั้งสองห่างกัน 6.9× ในเอาต์พุต ในการรันดัชนี ทั้งสองห่างกัน 29× ในต้นทุนของคำตอบ ตัวคูณที่อยู่ตรงกลางคือความยืดยาว: Grok 4.7 สร้างโทเค็นเอาต์พุต 240 ล้าน เทียบกับค่ามัธยฐาน 88 ล้านสำหรับคลาสของมัน และ MiMo-V2.6-Pro สร้าง 140 ล้าน นั่นคือโทเค็นที่แพงขึ้น 1.71× ซ้อนอยู่บนอัตราที่แพงขึ้น 6.9× และ 1.71 × 6.9 เท่ากับ 11.8 — ระยะที่เหลือไปถึง 29 มาจากฝั่งอินพุต ซึ่งส่วนลดแคช 99% ของ MiMo-V2.6-Pro และอัตราอินพุต $0.43 ทำงานหนักในเวิร์กโหลดที่มีคำนำหน้าที่ซ้ำกันเลย

ความยืดยาวคือตัวเลขที่ผู้คนมักมองข้ามในการประเมิน
โมเดลต้นทุนมักสร้างขึ้นจากตารางราคาและจำนวนโทเคนที่สมมติไว้ ทั้งสองส่วนนั้นผิดในกรณีนี้ ตารางราคาผิดเพราะส่วนลดแคชไม่ใช่หมายเหตุเล็ก ๆ — 99% เทียบกับ 75% คือความแตกต่างระหว่าง system prompt ที่ทำให้คุณเสียเงินทุกครั้งที่เรียกใช้ กับที่แทบไม่เสียเงินเลย จำนวนโทเคนผิดเพราะสองโมเดลไม่ได้ปล่อยจำนวนโทเคนเท่ากันสำหรับงานเดียวกัน และผู้ประเมินได้วัดความแตกต่างไว้: 240 ล้าน เทียบกับ 140 ล้าน ซึ่งเป็นการต่างกัน 1.71× บน benchmark เดียวกัน
ทั้งสองอย่างนั้นไม่ใช่ตัวชี้วัดที่คุณอ่านได้จากสเปกชีต อันดับความเยิ่นเย้อของ Grok 4.7 อยู่ที่ #94 จาก 210 โมเดลในคลาสของมัน ส่วนอันดับด้านต้นทุนของ MiMo-V2.6-Pro อยู่ที่ #12 จาก 114 ในคลาสของมัน ทีมที่อ้างอิงเรทการ์ดของ Grok 4.7 และสมมติว่าภาระงานเป็นกลางต่อจำนวนโทเคน จะคาดการณ์ได้ราวหนึ่งในสี่ของสิ่งที่ดัชนีใช้จ่ายจริงต่องาน การแก้ให้ถูกต้องไม่ใช่การใช้ต้นทุนของดัชนีเป็นค่าประมาณของคุณเช่นกัน — มันเป็นเพียงการวัดรูปร่างของเบนช์มาร์กหนึ่งรายการ การแก้ให้ถูกต้องคือการวัดจำนวนโทเคนของคุณเองทั้งสองฝั่งก่อนตัดสินใจ เพราะช่องว่างระหว่างสองโมเดลคือ 6.9× บนกระดาษและ 29× ในทางปฏิบัติ และมีเพียงหนึ่งในตัวเลขเหล่านั้นที่เป็นจริงสำหรับทราฟฟิกของคุณ

ทั้งคู่ช้า และนั่นไม่ใช่การเสมอกัน
Artificial Analysis วัดค่า Grok 4.7 ได้ 40 โทเค็นเอาต์พุตต่อวินาที และเรียกมันว่า “อยู่ในกลุ่มที่ช้าที่สุด”; MiMo-V2.6-Pro อยู่ที่ 43.6 และเรียกมันว่า “ช้าอย่างเห็นได้ชัด” ค่าที่อ่านได้ทั้งสองนี้ใกล้กันมากพอที่ความเร็วไม่ควรเป็นตัวตัดสินระหว่างสองรุ่นนี้ แต่ค่ามัธยฐานที่รองลงมาไม่เป็นเช่นนั้น: 67.1 สำหรับกลุ่มโมเดลน้ำหนักเปิดที่ MiMo-V2.6-Pro อยู่ ทั้งสองโมเดลต่ำกว่านั้นมาก และ MiMo-V2.6-Pro ยังมีเวลาถึงโทเค็นแรก 3.17 วินาที เทียบกับค่ามัธยฐาน 2.31 วินาที ซึ่งเป็นตัวเลขที่สร้างปัญหาในลูปแบบโต้ตอบมากกว่าแบบแบตช์
ดังนั้น สรุปตามจริงในด้านความหน่วงก็คือ การที่ราคาถูกกว่า 29 เท่าไม่ได้ซื้อผลิตภัณฑ์ที่เร็วขึ้นให้คุณ แต่ซื้อผลิตภัณฑ์ที่ช้าลงในราคาที่ถูกลง — และถ้าผู้ใช้ของคุณกำลังจ้องมองเคอร์เซอร์อยู่ การรอ 3.17 วินาทีอาจมีต้นทุนสูงกว่าโทเคนที่ประหยัดได้ สำหรับงานแบตช์ที่รันข้ามคืน การประเมินแบบออฟไลน์ หรือไปป์ไลน์ใดก็ตามที่เวลาวัดกันเป็นชั่วโมง การแลกเปลี่ยนนี้ตรงไปตรงมา และความถูกกว่า 29 เท่านั้นแทบไม่มีต้นทุนเลย
สิ่งที่เราเตอร์สามารถทำได้และทำไม่ได้กับการจับคู่นี้
นี่คือการจับคู่ที่แค็ตตาล็อกของเราเองเอนเอียงไปด้านเดียวจริง ๆ และก็คุ้มค่าที่จะพูดตรง ๆ เกี่ยวกับเรื่องนี้ Grok 4.7 เปิดให้ใช้งานบน OrcaRouter ในชื่อ grok/grok-4.7 ที่ราคาของผู้ให้บริการเอง $2.00 / $6.00 พร้อมเอาต์พุตสูงสุด 450K และปลายทางที่เข้ากันได้กับ OpenAI-SDK ที่ https://api.orcarouter.ai/v1 — ดังนั้นหากการเปรียบเทียบทำให้คุณอยากได้โมเดล xAI ภายใต้คีย์เดียวกันกับทุกอย่างอื่น เส้นทางนั้นมีอยู่แล้วในวันนี้ Xiaomi MiMo-V2.6-Pro ไม่ได้อยู่บนเส้นทางของเรา สำหรับฝั่งนั้น คำตอบคือ API ของผู้ขายเอง หรือผู้ให้บริการรายใดก็ตามในสามรายที่ระบุไว้ซึ่งคุณใช้อยู่แล้ว และเราจะไม่แกล้งทำเป็นอย่างอื่น
จุดที่เราเตอร์พิสูจน์คุณค่าในลักษณะนี้คือส่วนที่ไม่ใช่ตัวโมเดล การใช้คีย์เดียวข้ามโมเดลมากกว่า 200 รายการที่ราคาตั้งต่อรายการของผู้ให้บริการแต่ละรายโดยบวกเพิ่ม 0% หมายความว่าการลดราคาของผู้ขายจะลงในใบแจ้งหนี้ของคุณในวันเดียวกัน แทนที่จะเป็นตอนต่อสัญญารอบถัดไป การสลับไปใช้เส้นทางสำรองอัตโนมัติหมายความว่าเส้นทาง 40 t/s ที่ประสิทธิภาพลดลงจะไม่ลากไปป์ไลน์ของคุณไปด้วย ส่วน DSL สำหรับจัดเส้นทางช่วยให้แยกตามต้นทุนต่องานที่ประกาศไว้ แทนที่จะแบ่งตามความภักดีต่อแบรนด์ — โมเดลราคาถูกสำหรับปริมาณสูง โมเดลที่แข็งแกร่งสำหรับการเรียกที่ยาก ตัดสินใจต่อคำขอ และสำหรับเวิร์กโหลดที่ทั้งสองโมเดลไม่เหมาะนัก การผสานโมเดลสามารถรันหลายโมเดลอยู่เบื้องหลังการเรียกครั้งเดียว

คำถามที่การเปรียบเทียบนี้มักทำให้เกิดขึ้น
ค่า 29× ยังใช้ได้กับปริมาณงานของฉันหรือไม่? เฉพาะในกรณีที่ส่วนผสมโทเค็นของคุณใกล้เคียงกับของการรันดัชนีเท่านั้น หากเอาต์พุตของคุณสั้น และพรอมป์ของคุณยาวและถูกแคชไว้ ตัวคูณจะยุบลงเข้าหาช่องว่างอัตราที่ 6.9× บนเอาต์พุต และจะกว้างขึ้นบนอินพุต โดยที่ส่วนลด 99% ของ MiMo-V2.6-Pro คือปัจจัยชี้ขาด หากเอาต์พุตของคุณเป็นร่องรอยการให้เหตุผลแบบยาว ตัวคูณจะกว้างเกิน 29× เพราะบทลงโทษความยาวเฟ้อของ Grok 4.7 เป็นสัดส่วนกับความยาวเอาต์พุต
เลข 46 ทั้งสองฝั่งเป็น 46 เดียวกันหรือไม่ เป็นดัชนีเดียวกัน เวอร์ชันเดียวกัน และสเกลเดียวกัน — คะแนนย่อยพื้นฐานอยู่ที่ 46.32 และ 46.45 ห่างกัน 0.13 จุด และดัชนีปัดทั้งสองค่าเป็น 46 Artificial Analysis ไม่เผยแพร่ข้อมูลแยกย่อยรายการประเมินสำหรับโมเดลใดในสองรุ่นนี้ ดังนั้นคะแนนรวมจึงเป็นระดับที่ละเอียดที่สุดที่มีให้ และความแตกต่าง 0.13 จุดไม่ควรถูกตีความเป็นอันดับขีดความสามารถ
โปรเจกต์ใหม่ควรตั้งค่าเริ่มต้นเป็นตัวไหน ถ้าลักษณะงานเป็นแบบแบตช์ ทนต่อความหน่วง และไวต่อต้นทุน MiMo-V2.6-Pro ที่ราคา $0.13 ต่องานคือค่าเริ่มต้น และการที่โมเดลเปิดเผยเวต (open weights) หมายความว่าคุณไม่ต้องผูกความเสี่ยงไว้กับราคาของผู้ให้บริการรายใดรายหนึ่ง ถ้าคุณต้องการโมเดลของ xAI โดยเฉพาะ — ผลลัพธ์จากฮาร์เนส Grok Build, อันดับใน AA-Briefcase, คอนเท็กซ์ 500K พร้อมจุดตัดข้อมูลเดือนพฤษภาคม 2026 — Grok 4.7 เป็นเส้นทางที่ใช้ได้จริงบน OrcaRouter ในตอนนี้ และค่าพรีเมียมต่องานคือราคาที่ต้องจ่ายสำหรับความสามารถเฉพาะนั้น ไม่มีโมเดลใดในนี้ที่ชนะทั้งสองด้าน
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
