
MiMo-V2.6-Pro กับ Gemini 3.1 Pro: ช่องว่าง 16 จุดที่เกิดขึ้นเฉพาะบนดัชนีเวอร์ชันเดียว
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
วาง Xiaomi MiMo-V2.6-Pro และ Gemini 3.1 Pro Preview ไว้เคียงข้างกันบน Artificial Analysis Intelligence Index แล้วคุณจะได้ 46 ต่อ 30 — ความได้เปรียบสิบหกจุดสำหรับโมเดลที่มีค่าใช้จ่ายด้านอินพุตเพียงหนึ่งในห้า วางพวกมันเคียงข้างกันบนตัวเลขที่ทั้งสองผู้จำหน่ายเผยแพร่ ณ การเปิดตัวของตนเอง แล้ว Gemini 3.1 Pro ชนะไปสิบเอ็ด คะแนนทั้งสองแบบมาจากผู้ประเมินรายเดียวกัน เหตุผลที่พวกมันขัดแย้งกันคือสิ่งที่มีประโยชน์ที่สุดสิ่งเดียวที่ควรเข้าใจเกี่ยวกับการเปรียบเทียบโมเดลในเดือนกันยายน 2026: ดัชนีนั้นถูกสร้างใหม่ภายใต้ทั้งสองโมเดล และคะแนนจะมีความหมายก็ต่อเมื่ออยู่ข้างหมายเลขเวอร์ชันที่สร้างมันขึ้นมา
คอมโพสิต v4.3.2 เป็นชุดปัจจุบัน โดยรันการประเมินสิบรายการ — AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience และ AA-LCR v1.1 — และบนชุดนี้ เมื่ออ่านค่า ณ วันที่ 22 กันยายน 2026 โมเดลของ Xiaomi ได้ 46 คะแนน และของ Google ได้ 30 คะแนน ตอนเปิดตัวเมื่อวันที่ 19 กุมภาพันธ์ 2026 มีรายงานว่า Gemini 3.1 Pro Preview อยู่ที่ 57 บนสเกลที่ใช้ในขณะนั้น ซึ่งขึ้นเป็นอันดับหนึ่งของบอร์ด ตัวเลข Gemini สองค่านี้ไม่ใช่การลดลง แต่เป็นไม้บรรทัดที่ต่างกันสองอัน
แต่ละโมเดลจริงๆ แล้วคืออะไร
Gemini 3.1 Pro Preview เป็นโมเดลการให้เหตุผลระดับแนวหน้าของ Google เปิดตัวเมื่อวันที่ 19 กุมภาพันธ์ 2026 และยังคงติดป้าย preview อยู่แม้ผ่านไปเจ็ดเดือน มีหน้าต่างบริบทขนาด 1 ล้านโทเคน จำกัดเอาต์พุตไว้ที่ 65,536 โทเคน — ซึ่ง Artificial Analysis ระบุเป็น 64K และหน้าโมเดลของเราเองระบุเป็น 65K — และรับข้อความ รูปภาพ PDF เสียง และวิดีโอเป็นอินพุต ส่งออกเป็นข้อความ เป็นโมเดลแบบ proprietary โดยไม่เปิดเผยจำนวนพารามิเตอร์ และมีจุดตัดความรู้ที่มกราคม 2025 API ของ Google เองคิดราคา 2.00 ดอลลาร์ต่อล้านโทเคนอินพุต และ 12.00 ดอลลาร์ต่อล้านโทเคนเอาต์พุต เมื่ออินพุตต่ำกว่า 200K และปรับเป็น 4.00 และ 18.00 ดอลลาร์เมื่อสูงกว่านั้น โดยอินพุตที่แคชไว้ราคา 0.20 ดอลลาร์
Xiaomi MiMo-V2.6-Pro เปิดให้ใช้งานทั่วไปเมื่อวันที่ 22 กันยายน 2026 โดยที่คลังเช็กพอยต์ที่ผ่านการเรียนรู้แบบเสริมกำลังปรากฏขึ้นเมื่อวันก่อนหน้า เป็นโมเดลแบบ sparse mixture-of-experts ที่มีพารามิเตอร์รวม 1.02 ล้านล้านตัว และเปิดใช้งาน 42 พันล้านตัวต่อโทเคน มีหน้าต่างบริบทขนาด 1 ล้านโทเคน รองรับหลายรูปแบบโดยกำเนิดทั้งข้อความ รูปภาพ วิดีโอ และเสียง และมีเวตที่ดาวน์โหลดได้ภายใต้สัญญาอนุญาต MIT Xiaomi คงราคาของ MiMo-V2.5 เจเนอเรชันก่อนหน้าไว้ แทนที่จะปรับราคาเช็กพอยต์ใหม่ให้สูงขึ้น: 0.43 ดอลลาร์ต่ออินพุต 1 ล้านโทเคน และ 0.87 ดอลลาร์ต่อเอาต์พุต 1 ล้านโทเคน พร้อมส่วนลดแคช 99% และอัตราเฉลี่ยถ่วงที่ 0.18 ดอลลาร์ ในการผสมแบบ 7:2:1 ของแคชฮิต/อินพุต/เอาต์พุต
• ค่าน้ำหนัก — Xiaomi MiMo-V2.6-Pro ได้รับสัญญาอนุญาตแบบ MIT และดาวน์โหลดได้; Gemini 3.1 Pro Preview เป็นกรรมสิทธิ์ ใช้ผ่าน API เท่านั้น
• พารามิเตอร์ — MiMo-V2.6-Pro 1.02T ทั้งหมด / 42B ที่ใช้งานอยู่; Gemini 3.1 Pro Preview ไม่เปิดเผย
• บริบท — ทั้งคู่มี 1M โทเคน; Gemini 3.1 Pro Preview จำกัดเอาต์พุตไว้ที่ 65,536 โทเคน ขณะที่ MiMo-V2.6-Pro ไม่ได้เผยแพร่ขีดจำกัดที่เทียบเท่า
• โมดัลลิตี้ — MiMo-V2.6-Pro รับข้อความ รูปภาพ วิดีโอ และเสียง; Gemini 3.1 Pro Preview รับข้อความ รูปภาพ PDF เสียง และวิดีโอ
• ราคาตามประกาศ — MiMo-V2.6-Pro $0.43 / $0.87 ต่อ 1M โทเค็น; Gemini 3.1 Pro Preview $2.00 / $12.00 เมื่ออินพุตต่ำกว่า 200K, $4.00 / $18.00 เมื่อสูงกว่า
• แคช — MiMo-V2.6-Pro ลดราคา 99%; Gemini 3.1 Pro Preview $0.20 ต่อการอ่านที่แคชไว้ 1M ครั้ง
• ความเร็ว — MiMo-V2.6-Pro 134.3 โทเค็นเอาต์พุต/วินาที; Gemini 3.1 Pro Preview 121.8
• เวลาถึงโทเคนแรก — MiMo-V2.6-Pro 2.15 วินาที; Gemini 3.1 Pro Preview 63.62 วินาที
• ต้นทุนที่วัดได้สำหรับการรันดัชนี — MiMo-V2.6-Pro $206.66 หรือ $0.13 ต่องาน; Gemini 3.1 Pro Preview $1,310.21 หรือ $0.67 ต่องาน

ป้ายตัวอย่างคือความแตกต่างที่แท้จริง
ทุกอย่างข้างต้นเป็นข้อกำหนด บรรทัดเดียวที่เปลี่ยนวิธีที่คุณควรอ่านการเปรียบเทียบทั้งหมดคือคำว่า "preview" โมเดล preview เป็นตัวเลือกที่ Google ยังไม่ผูกมัดว่าจะคงไว้ที่เอนด์พอยต์นั้น ซึ่ง matters ต่อหน้าเปรียบเทียบในแบบที่ช่องว่างดัชนี 16 จุดทำไม่ได้ เพราะโมเดลที่คุณไว้ใจไม่ได้ว่าจะยังอยู่ตรงนั้นในอีกหกเดือน ไม่ใช่โมเดลที่คุณจะกำหนดเป็นมาตรฐาน — และตระกูลของ Google เองก็ก้าวข้ามมันไปแล้ว Gemini 3.6 Flash และ Gemini 3.8 Flash อยู่เหนือ Gemini 3.1 Pro ในงานเขียนโค้ดและงานแบบเอเจนต์ด้วยต้นทุนที่ต่ำกว่า ซึ่งเป็นเหตุผลที่บทวิจารณ์ทางเทคนิคชิ้นหนึ่งของการเปิดตัว 3.1 Pro อธิบายว่ามันเป็นรุ่นก่อนหน้าอย่างชัดเจน หน้า AA เองก็จัดอันดับมันไว้ที่อันดับ 71 จาก 202 ด้านความฉลาด
โมเดลของ Xiaomi อยู่ในตำแหน่งตรงกันข้าม มันเปิดตัวในสัปดาห์นี้ น้ำหนักโมเดลเผยแพร่ภายใต้ MIT และคุณลักษณะด้านการเสิร์ฟคือจุดที่แข็งแกร่งที่สุดของมัน 134.3 โทเคนเอาต์พุตต่อวินาทีจัดให้อยู่ที่อันดับ 11 จาก 114 โมเดลที่วัดความเร็ว และ 2.15 วินาทีถึงโทเคนแรกนั้นเร็วกว่า 63.62 วินาทีของ Gemini 3.1 Pro Preview ประมาณสามสิบเท่า สำหรับแอปพลิเคชันแบบอินเทอร์แอกทีฟ นั่นไม่ใช่แค่ตัวตัดสินเมื่อคะแนนเสมอกัน มันคือความแตกต่างระหว่างผลิตภัณฑ์กับเดโม และเป็นตัวเลขที่มีแนวโน้มที่สุดว่าจะมองไม่เห็นบนตาราง benchmark
เงินไปไหนจริง ๆ
การคำนวณต่อโทเคนunderstatesช่องว่างระหว่างสองตัวนี้ เพราะโมเดลไม่ได้ใช้จำนวนโทเคนเท่ากันเพื่อทำงานเดียวกันให้เสร็จ ตัวเลขที่ชัดเจนกว่าคือสิ่งที่ Artificial Analysis วัดเพื่อรัน Intelligence Index ฉบับเต็มกับแต่ละตัว: $206.66 สำหรับ MiMo-V2.6-Pro และ $1,310.21 สำหรับ Gemini 3.1 Pro Preview ชุดทดสอบเดียวกัน ฮาร์เนสเดียวกัน วัดด้วยวิธีเดียวกัน — ความต่าง 6.3 เท่าบนชุดงานที่เหมือนกัน และเป็นความต่างที่คำนึงถึงข้อเท็จจริงที่ว่าโมเดลแบบ reasoning ปล่อยโทเคนจำนวนมากออกมาตอนคิดอยู่แล้ว Gemini 3.1 Pro Preview สร้างโทเคนเอาต์พุต 67 ล้านโทเคนทั่วทั้งดัชนี; ค่ามัธยฐานของโมเดลในระดับราคาเดียวกันคือ 90 ล้าน ดังนั้นจริง ๆ แล้วมันประหยัดกว่าคู่แข่งต่อคะแนนหนึ่งหน่วย และยังคงมีค่าใช้จ่ายในการประเมินมากกว่าโมเดล Xiaomi ถึงหกเท่า
จากนั้นก็เอา production loop มาวิ่งกับมัน การรันเอเจนต์ 30 ขั้นตอนที่อ่านบริบท 200,000 โทเคนต่อขั้นตอนและเขียน 2,000 โทเคนต่อขั้นตอน คือ 6 ล้านโทเคนอินพุตและ 60,000 โทเคนเอาต์พุตต่อการรันหนึ่งครั้ง บน Gemini 3.1 Pro Preview ที่ต่ำกว่าระดับ 200K นั่นคือ $12.00 ของอินพุตและ $0.72 ของเอาต์พุต — $12.72 ต่อการรัน บน MiMo-V2.6-Pro คือ $2.58 และ $0.05 — $2.63 หากข้าม 200,000 โทเคนของอินพุตบนโมเดล Google อัตราอินพุตจะเพิ่มเป็นสองเท่าเป็น $4.00 ณ จุดนั้นลูปเดิมมีค่าใช้จ่าย $24.00 ก่อนเอาต์พุต การแคชเปลี่ยนตัวเลขทั้งสอง แต่ส่วนลด 99% บนโมเดลราคาถูกเมื่อเทียบกับการอ่านแคช $0.20 บนโมเดลราคาแพง ทำให้โมเดลราคาแพงยังคงนำอยู่ในแง่ค่าใช้จ่ายหนึ่งอันดับขนาดบนลูปที่ใช้บริบทหนัก

คำถามเรื่องการกำหนดเส้นทาง หากพูดกันตามตรง
นี่คือส่วนที่ทำให้เข้าใจผิดได้ง่าย Gemini 3.1 Pro Preview อยู่บน OrcaRouter ในชื่อ google/gemini-3.1-pro-preview ซึ่งเข้าถึงได้ผ่านคีย์ที่เข้ากันได้กับ OpenAI เพียงคีย์เดียว ในราคา list price ของผู้ให้บริการ โดยบวกเพิ่ม 0% ดังนั้นเมื่อ Google เปลี่ยนราคา ฝั่งเราจะสะท้อนการเปลี่ยนแปลงให้ทันทีในวันเดียวกัน แทนที่จะเป็นรอบบิลถัดไป Xiaomi MiMo-V2.6-Pro ไม่ได้อยู่บน OrcaRouter และไม่มีโมเดล Xiaomi ใดอยู่เลย การบอกเช่นนี้ตรง ๆ มีประโยชน์กว่าการปล่อยให้หน้าโมเดลสื่อเป็นนัยเป็นอย่างอื่น การจะเข้าถึงมันในวันนี้ต้องใช้แพลตฟอร์มของ Xiaomi เอง หรือแคตตาล็อกของบุคคลที่สามที่ระบุโมเดลนี้
ความไม่สมมาตรนั้นคือเหตุผลที่เราเตอร์มีที่ยืนในบทเปรียบเทียบนี้ แทนที่จะเป็นแค่หมายเหตุท้ายบท โมเดลทั้งสองไม่ได้แข่งขันกันสำหรับคำขอเดียวกัน Gemini 3.1 Pro Preview คือผู้ครองตลาดที่คุณอาจจ่ายเงินอยู่แล้ว และคำถามที่หน้านี้ตอบคือโมเดลราคาถูกตัวใหม่สามารถแย่งส่วนแบ่งทราฟฟิกของมันได้หรือไม่ การทดสอบนั้นอย่างถูกต้องหมายถึงการส่งพรอมต์ของคุณเองไปยังทั้งสองตัวแล้วเปรียบเทียบคำตอบ ไม่ใช่การอ่านดัชนี และการทำเช่นนั้นด้วยการเปิดสัญญาที่สอง คีย์ที่สอง และความสัมพันธ์ด้านการเรียกเก็บเงินที่สอง คือแรงเสียดทานที่ทำให้การทดสอบไม่เคยเกิดขึ้นเลย คีย์เดียว ทั้งสองเลนในจุดที่เราเราเตอร์ไป และการเปรียบเทียบก็กลายเป็นการเปลี่ยนคอนฟิกเท่านั้น การสลับสำรองอัตโนมัติครอบคลุมอีกครึ่งหนึ่ง โมเดลพรีวิวอาจถูกถอนหรือถูกจำกัดอัตราโดยแจ้งล่วงหน้าเพียงเล็กน้อย และเลนที่สองหลังปลายทางเดียวกันคือสิ่งที่เปลี่ยนเรื่องนั้นจากความล่มเป็นเพียงการตัดสินใจด้านการเราเตอร์

ควรเลือกอันไหนดี
เลือก Gemini 3.1 Pro Preview เมื่องานต้องการอินพุต PDF และเสียงแบบเนทีฟ เมื่อคุณอยู่ในระบบนิเวศของ Google อยู่แล้ว หรือเมื่อคุณต้องการพฤติกรรมของโมเดลนั้นโดยเฉพาะ และยอมรับความเสี่ยงที่ปลายทางพรีวิวจะถูกเลิกใช้งานได้ เวลาถึงโทเคนแรก 63 วินาทีของมันหมายความว่าในทางปฏิบัติ มันเป็นโมเดลสำหรับงานแบบแบตช์และเวิร์กโหลดออฟไลน์ ไม่ว่าฝ่ายการตลาดจะพูดถึงความเป็นอินเทอร์แอกทีฟอย่างไรก็ตาม
เลือก MiMo-V2.6-Pro เมื่อปริมาณงานคือข้อจำกัด เมื่อลูปมีบริบทหนักและทำซ้ำ ๆ เมื่อคุณต้องการเก็บเวตไว้บนฮาร์ดแวร์ของคุณเอง — สัญญาอนุญาต MIT เปิดให้ใช้งานเชิงพาณิชย์ ดัดแปลง และฝึกต่อได้ — หรือเมื่อความหน่วงของโทเคนแรกเป็นส่วนหนึ่งของผลิตภัณฑ์ นี่เป็นกรณีหายากของโมเดลราคาถูกที่เป็นโมเดลเร็วไปพร้อมกัน และการผสมผสานแบบนั้นมีค่ามากกว่าที่คะแนนดัชนีสิบหกจุดบ่งชี้ไว้
สิ่งที่ทำให้ภาพนี้เปลี่ยนไปคือรุ่นสืบทอดที่ไม่ใช่พรีวิวของ Gemini 3.1 Pro หรือการทำซ้ำอย่างอิสระของตัวเลข DeepSWE ที่ Xiaomi เผยแพร่จากฮาร์เนสของตัวเอง — 72.57 สำหรับ Pro, 65.68 สำหรับ Flash โดยขยับจาก 58.4 และ 48.8 ตามลำดับตลอดการรันแบบ reinforcement learning ตัวเลขเหล่านั้นเป็นตัวเลขที่ผู้ขายรายงาน ประเมินบนตัวให้คะแนนของ Xiaomi ด้วย mini-swe-agent แบบเฉลี่ยจากสามครั้ง และไม่ได้ส่งไปยังลีดเดอร์บอร์ดสาธารณะ จนกว่าจะมีใครรันซ้ำ ตัวเลข 46 ของ Artificial Analysis คือตัวเลขที่ควรอ้างอิง และมันวัดบนไม้บรรทัดเดียวกันกับ 30
OrcaRouter นำโมเดล 200+ รายการมาไว้ใน endpoint เดียวที่เข้ากันได้กับ OpenAI ในราคาตามรายการของผู้ให้บริการ โดยมีส่วนบวกเพิ่ม 0% ดังนั้นการเปลี่ยนแปลงราคาของผู้ขายจะมีผลในวันเดียวกัน
การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
