
MiniMax M3.1 Flash Preview vs MiniMax M3: เมื่อโมเดลใหม่คือรุ่นที่เสี่ยงกว่า
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 468 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 192 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1329 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
เอกสารของผู้ขายเองตอนนี้จัดให้ MiniMax-M3.1-Flash-Preview อยู่เหนือ MiniMax-M3 และการเรียงลำดับแบบนั้นก็ช่วยโน้มน้าวได้มากทีเดียว มันเป็นโมเดลข้อความรุ่นใหม่ล่าสุดในสายนี้ มีหน้าต่างบริบทขนาดหนึ่งล้านโทเคนเท่ากัน และเพิ่มการควบคุมความลึกในการคิดที่โมเดลรุ่นเก่าไม่มี สิ่งที่ตารางไม่ได้แสดงคือ โมเดลรุ่นเก่าเป็นรุ่นเดียวในสองรุ่นนี้ที่คุณดาวน์โหลดได้ คิดราคาต่อโทเคนได้ เปรียบเทียบกับสิ่งใดก็ได้ หรือเรียกใช้ได้โดยไม่ต้องสมัครสมาชิก — และรุ่นใหม่กว่านั้นได้นำสวิตช์ที่ MiniMax-M3 เคยมอบให้คุณออกไป
นี่ไม่ใช่เรื่องราวของโมเดลที่กำลังถูกแทนที่ แต่เป็นเรื่องราวของผู้ขายรายหนึ่งที่แยกสายผลิตภัณฑ์ของตนเองออกเป็นตัวทำงานหลักแบบคิดค่าบริการตามการใช้งาน กับพรีวิวที่ต้องสมัครสมาชิกจึงเข้าถึงได้ และทั้งสองอย่างนี้ใช้แทนกันไม่ได้ทั้งสองทาง ต่อไปนี้คือสิ่งที่แต่ละตัวเป็นจริง ๆ
สเปกชีตทั้งสองฉบับ วางเคียงข้างกัน
เริ่มจากสิ่งที่หน้าของผู้ขายเองระบุไว้สำหรับทั้งสอง เพราะลักษณะของความแตกต่างปรากฏที่นี่มากกว่าในตารางเบนช์มาร์ก
• ประกาศเปิดตัว — MiniMax-M3 เมื่อวันที่ 1 มิถุนายน 2026 พร้อมบันทึกสถาปัตยกรรม ตารางเบนช์มาร์ก และอัตราค่าบริการ; MiniMax-M3.1-Flash-Preview เมื่อวันที่ 27 กันยายน 2026 พร้อมรายการเอกสารและโพสต์บนบัญชีเอเจนต์ของ MiniMax • หน้าต่างบริบท — 1,000,000 โทเคนสำหรับทั้งสองรุ่น ตามตารางโมเดลของ MiniMax เอง • เอาต์พุตสูงสุด — 512,000 โทเคนสำหรับ MiniMax-M3 บนรายการแคตตาล็อกของเรา ซึ่งเป็นตัวเลขที่ MiniMax เองไม่ได้เผยแพร่; ไม่มีการเผยแพร่ที่ใดเลยสำหรับ MiniMax-M3.1-Flash-Preview • รูปแบบอินพุต — ข้อความ รูปภาพ และวิดีโอเข้า ข้อความออก สำหรับทั้งสองรุ่น • การควบคุมการคิด — พารามิเตอร์ thinking ที่ MiniMax-M3 สามารถสั่งให้ข้ามได้ และสามารถแยกออกเป็นฟิลด์ reasoning_details ได้ผ่าน reasoning_split; บน MiniMax-M3.1-Flash-Preview การคิดเป็นสิ่งบังคับ และ reasoning_split ไม่สามารถปิดได้ • ความลึกของการคิด — ไม่มีใน MiniMax-M3; มีบันได effort ประกอบด้วย low, medium, high, xhigh และ max โดยมีค่าเริ่มต้นเป็น max บน MiniMax-M3.1-Flash-Preview • ความเร็วเอาต์พุตที่เผยแพร่ — ประมาณ 100+ โทเคนต่อวินาทีสำหรับ MiniMax-M3 ตามตารางโมเดลของ MiniMax เอง; ไม่มีข้อมูลที่เผยแพร่สำหรับ MiniMax-M3.1-Flash-Preview • น้ำหนักโมเดล — MiniMax-M3 เป็นแบบเปิดน้ำหนักและมีคลังสาธารณะ; MiniMax-M3.1-Flash-Preview ไม่มี • ราคา — 0.30 ดอลลาร์ต่อล้านโทเคนอินพุต และ 1.20 ดอลลาร์ต่อล้านโทเคนเอาต์พุตสำหรับ MiniMax-M3 ในอัตราของผู้ให้บริการ; ไม่มีอัตราต่อโทเคนสำหรับ MiniMax-M3.1-Flash-Preview • การเข้าถึง — MiniMax-M3 ใช้แบบจ่ายตามการใช้งานจริงและใน Token Plan และสามารถเรียกใช้ผ่านแพลตฟอร์มของบุคคลที่สามได้; MiniMax-M3.1-Flash-Preview ใช้ได้เฉพาะบน Token Plan และ MiniMax Code เท่านั้น
สองแถวตรงนั้นจัดอยู่ในหมวดหมู่ที่ต่างจากแถวที่เหลือ ความเร็วเอาต์พุตที่เผยแพร่เป็นตัวเลขของผู้ขายสำหรับรุ่นเก่าเท่านั้น ดังนั้นรุ่นใหม่จึงถูกวางขายว่าเป็นรุ่นที่เร็วโดยไม่มีตัวเลขกำกับ และการควบคุมการคิดได้เคลื่อนไปในทิศทางตรงข้ามกับการตลาด: รุ่นใหม่ให้การควบคุมที่ละเอียดยิ่งขึ้นว่ามันคิดมากแค่ไหน ขณะเดียวกันก็ตัดความสามารถของคุณในการหยุดมันไม่ให้คิดเลยออกไป
สวิตช์ที่ MiniMax เอาไป
นี่คือรายละเอียดที่อาจก่อปัญหาได้มากที่สุด และมันถูกบันทึกไว้เป็นเอกสารแทนที่จะซ่อนไว้ สำหรับ MiniMax-M3 การส่ง thinking: {"type": "disabled"} บน endpoint ที่เข้ากันได้กับ OpenAI จะข้ามการคิดและคืนคำตอบโดยตรง; บน endpoint ที่เข้ากันได้กับ Anthropic การคิดจะปิดไว้เป็นค่าเริ่มต้นและสามารถเปิดใช้งานได้ด้วย adaptive. บน MiniMax-M3.1-Flash-Preview คำขอเดียวกันจะคืนค่า HTTP 400 พร้อมข้อความ จำเป็นต้องใช้ adaptive thinking. ไม่มีวิธีที่รองรับในการรับคำตอบที่ไม่ใช่การให้เหตุผล
ในทางปฏิบัติ นั่นหมายความว่าเวิร์กโหลดที่ใช้ MiniMax-M3 เป็นตัวแยกประเภทหรือเราเตอร์ที่ราคาถูกและรวดเร็ว — พร้อมต์สั้นเข้า คำตอบแบบมีโครงสร้างสั้นออก ไม่มี chain of thought — ไม่มีเส้นทางอัปเกรดแบบใช้แทนได้ทันทีไปยังโมเดลที่ใหม่กว่า คุณสามารถลด effortลงเป็นlow และคำแนะนำของ MiniMax ระบุชัดเจนว่าการลด effort เป็นวิธีที่ตั้งใจให้ใช้เพื่อลดความหน่วงและโทเคนในการคิด แทนที่จะปิดการคิดเสียเลย แต่โทเคนและความหน่วงไม่ได้ลดลงเหลือศูนย์ และสำหรับงานสกัดข้อมูลปริมาณสูงที่เขียนสี่ฟิลด์ต่อการเรียกหนึ่งครั้ง "คิดก่อนเสมอ" มีรูปแบบต้นทุนที่แตกต่างจาก "คิดเมื่อถูกขอ"

จริง ๆ แล้ววัดอะไรบนแต่ละอัน
ด้านหนึ่งของการเปรียบเทียบนี้มีตัวเลข ส่วนอีกด้านหนึ่งมีคอลัมน์ว่าง และเป็นเรื่องที่ควรระบุให้ชัดเจนว่าตัวเลขใดเป็นของใคร
ผลการประเมินอิสระของ MiniMax-M3 เป็นของจริง: Artificial Analysis จัดให้อยู่ที่ 29.2 บน Intelligence Index — อันดับ 60 จาก 145 — โดยได้ 58.6 บน Coding Index, 59.18 บนดัชนีคณิตศาสตร์ของตน, 92.9% บน GPQA Diamond ภายใต้กลุ่มดัชนีเดียวกัน, 83% ในการเรียกคืนบริบทแบบยาว และ 82.9% บน IFBench ทั้งหมดนี้คือการประเมินโดยบุคคลที่สามต่อโมเดลที่ใครก็ดาวน์โหลดและรันซ้ำได้ ส่วนตัวเลขเปิดตัวของ MiniMax เองสำหรับ M3 — BrowseComp ที่ 83.5%, SWE-Bench Pro ที่ 59.0%, Terminal-Bench 2.1 ที่ 66.0%, MCP Atlas ที่ 74.2%, OSWorld-Verified ที่ 70% — เป็นตัวเลขของผู้จำหน่าย และเราไม่เคยเห็นว่ามีการทำซ้ำผลเหล่านั้น
MiniMax-M3.1-Flash-Preview ไม่มีทั้งสองอย่าง MiniMax ไม่ได้เผยแพร่ตารางเปรียบเทียบใด ๆ และโมเดลนี้ก็ไม่มีรายการอยู่ในดัชนีของ Artificial Analysis ดังนั้นจึงไม่มีคะแนนอิสระ ไม่มีดัชนีการเขียนโค้ด ไม่มีตัวเลขการเรียกคืนบริบทยาว และไม่มีการวัดอาการหลอน ทุกคำบรรยายลักษณะของมันที่หมุนเวียนอยู่ — "เร็ว", "เร็ว", "สร้างมาเพื่อการพัฒนาประจำวัน" — ล้วนเป็นคำคุณศัพท์ของผู้ขายเองตอนเปิดตัว การไม่มีข้อมูลนี้ควรกล่าวให้ชัดเจน เพราะมันให้ผลได้ทั้งสองทาง: ยังไม่มีอะไรถูกแสดงว่าแย่กว่า และยังไม่มีอะไรถูกแสดงว่าดีกว่า
ความไม่สมมาตรนี้คือทั้งหมดของการตัดสินใจ คุณสามารถประเมิน MiniMax-M3 ได้บ่ายนี้โดยการดาวน์โหลดมันหรือเรียกใช้งานมัน และคุณสามารถเทียบการประเมินนั้นกับกระดานคะแนนสาธารณะได้ กับ MiniMax-M3.1-Flash-Preview คุณทำได้เพียงใช้งานมันและสร้างความเห็นส่วนตัวเท่านั้น
จุดที่โมเดลใหม่ชนะอย่างแท้จริง
มันเป็นเรื่องง่ายที่จะอ่านข้อความข้างต้นเป็นการโต้แย้งให้เพิกเฉยต่อโมเดลใหม่ และนั่นก็ไม่ใช่ข้อสรุปที่ถูกต้องเช่นกัน มีสามสิ่งที่เป็นจริงและเฉพาะเจาะจงกับมัน
บันไดความพยายาม (effort ladder) เป็นความสามารถที่มีอยู่จริง ไม่ใช่แค่สวิตช์เปิด-ปิด ห้าระดับ — ต่ำ ถึง สูงสุด — ช่วยให้โมเดลเดียวรองรับทั้งงานเปลี่ยนชื่อทั่วไปและการรีแฟกเตอร์ทั้งรีโพซิทอรีด้วยต้นทุนการประมวลผลที่แตกต่างกัน และมีเอกสารระบุว่าได้ผลเฉพาะกับ MiniMax-M3.1-Flash-Preview เท่านั้น บน MiniMax-M3 ทางเลือกของคุณมีเพียงสองอย่าง หากปัญหาของคุณคือคุณคาดเดาความหน่วงของแต่ละงานไม่ได้ ความลึกที่ปรับได้ก็คือสิ่งที่คุณต้องการพอดี
มันเป็นโมเดลระดับท็อปสุดของตารางในปัจจุบันของผู้ขายรายนี้ ซึ่งหมายความว่ามันสืบทอดทุกสิ่งที่สายเลือด M-series ได้เรียนรู้มาตั้งแต่เดือนมิถุนายน และ MiniMax ระบุชัดเจนว่ามันเป็นโมเดลล่าสุดสำหรับการให้เหตุผลแบบเอเจนต์ การใช้เครื่องมือ การเขียนโค้ด และงานที่ใช้บริบทขนาดยาว กลไกการใช้เครื่องมือแบบคิดสลับไปมา (interleaved-thinking) ที่ M3 นำมาใช้นั้นยังคงสืบทอดต่อมา รวมถึงข้อกำหนดให้ผนวกคำตอบแบบเต็ม — ทั้งบล็อกการคิดและส่วนอื่น ๆ ทั้งหมด — กลับเข้าสู่ประวัติข้อความ
และมันรองรับวิดีโอ ในราคาระดับ Flash ภายใต้การสมัครสมาชิก MiniMax-M3 ก็ทำได้เช่นกัน ในราคาต่อโทเคน หากคุณจ่ายค่าที่นั่งใน Token Plan อยู่แล้ว และอุปสรรคเดียวที่ขวางคุณจากการใช้อินพุตวิดีโอคือต้นทุนส่วนเพิ่มต่อการเรียกใช้ M3.1-Flash-Preview ก็ขจัดอุปสรรคนั้นออกไป
ในกรณีที่โมเดลรุ่นเก่ายังคงเป็นตัวเลือกที่ต้องเรียกใช้
สามกรณี ซึ่งทั้งหมดเป็นเรื่องเกี่ยวกับความสามารถในการคาดการณ์มากกว่าคุณภาพ
เมื่อคุณจำเป็นต้องจำลองต้นทุน MiniMax-M3 มีตารางอัตราค่าบริการ ดังนี้ $0.30 ต่อล้านโทเคนอินพุต $1.20 ต่อล้านโทเคนเอาต์พุต และอัตราการอ่านแคชที่ $0.06 ต่อล้านตามแคตตาล็อกของเรา คุณสามารถประมาณค่าบริการรายเดือนของปริมาณงานหนึ่ง ๆ ได้แม่นยำถึงระดับเซนต์ก่อนที่จะรันมัน ส่วน MiniMax-M3.1-Flash-Preview ไม่มีอัตราค่าบริการต่อโทเคนปรากฏอยู่ที่ใดบนหน้าต่าง ๆ ของ MiniMax ดังนั้นต้นทุนของมันจึงเท่ากับค่าสมาชิกของคุณหารด้วยปริมาณการใช้งานของคุณ — ใช้ได้ดีกับงบประมาณแบบคงที่ แต่ไร้ประโยชน์สำหรับเศรษฐศาสตร์ต่อหน่วย
เมื่อคุณต้องการให้โมเดลเป็นโมเดลที่มั่นคงเหมือนเดิม MiniMax-M3 เป็นแบบเปิดน้ำหนัก: คุณสามารถดาวน์โหลดมันไปรันบนฮาร์ดแวร์ของคุณเอง และรู้ได้ว่าอาร์ติแฟกต์ที่ตอบคำเรียกของคุณในอีกหกเดือนข้างหน้าจะเป็นตัวเดียวกับที่ตอบอยู่ตอนนี้ MiniMax-M3.1-Flash-Preview ไม่มีเช็กพอยต์ และการเข้าถึงระดับพรีวิวหมายความว่าสแต็กการให้บริการ องค์ประกอบโควตา และความพร้อมใช้งาน ล้วนถูกควบคุมโดยผู้ขาย และอาจเปลี่ยนแปลงได้อย่างชัดเจน
เมื่อคุณต้องการคำตอบแบบไม่ใช้การให้เหตุผล ดังข้างต้น — นี่คือความถดถอยด้านความสามารถเพียงกรณีเดียวในการเปรียบเทียบ และเป็นกรณีที่ทำให้ผู้คนประหลาดใจ เพราะโมเดลใหม่ที่ไม่สามารถทำบางสิ่งซึ่งโมเดลเก่าทำได้ ไม่ใช่กรณีที่ใครวางแผนรับมือไว้

เรียกทั้งสองจากที่เดียว
ความน่าอึดอัดตรงนี้อยู่ที่ว่าโมเดลสองตัวนี้ถูกซื้อมาด้วยวิธีที่ต่างกัน — ตัวหนึ่งคิดค่าบริการตามการใช้งาน อีกตัวเป็นแบบสมัครสมาชิก — และสัญชาตญาณตามธรรมชาติก็คือเลือกข้างใดข้างหนึ่ง วิธีที่เกิดประโยชน์กว่าคือจัดเส้นทางระหว่างสองตัวตามลักษณะของงาน ซึ่งจะได้ผลก็ต่อเมื่อฝั่งที่คิดค่าบริการตามการใช้งานนั้นเข้าถึงได้จากที่เดียวกับทุกอย่างอื่น
MiniMax-M3 บน OrcaRouterคิดตามราคาที่ประกาศของ MiniMax โดยบวกส่วนเพิ่ม 0% ดังนั้น $0.30 และ $1.20 บนตารางราคาคือค่าใช้จ่ายจริงต่อการเรียกหนึ่งครั้ง โดยไม่มีกำไรส่วนเพิ่มจากแพลตฟอร์ม มันอยู่บนปลายทางที่เข้ากันได้กับ OpenAI เดียวกับ MiniMax M2.7 — ราคาป้ายเดียวกันที่ $0.30/$1.20 สำหรับหน้าต่าง 200,000 โทเคน และเป็นแบบโอเพนเวตเช่นกัน — และอยู่ในกลุ่มโมเดลอื่น ๆ อีกกว่า 200 รายการ ภายใต้คีย์ API เดียว โดยมีการสลับสำรองอัตโนมัติข้ามผู้ให้บริการ เมื่อปลายทางใดปลายทางหนึ่งสะดุด เมื่อเทียบกับข้อมูลเทเลเมทรีของเราเอง ซึ่งเป็นตัวเลขคนละแบบกับของผู้ขาย: ในช่วงเจ็ดวันที่ผ่านมา M3 ตอบด้วยความเร็วประมาณ 238 โทเคนเอาต์พุตต่อวินาที ที่ p50 ประมาณ 4.1 วินาทีถึงโทเคนแรก โดยมีอัตราข้อผิดพลาดใกล้ 0.15% วัดบน OrcaRouter playground หากคุณต้องการให้ MiniMax-M3 เป็นครึ่งที่เชื่อถือได้ของไปป์ไลน์ และมอง MiniMax-M3.1-Flash-Preview เป็นครึ่งทดลอง ครึ่งที่เชื่อถือได้ก็คือการกำหนดค่าเพียงหนึ่งบรรทัด แทนที่จะเป็นความสัมพันธ์กับผู้ขายรายที่สอง MiniMax-M3.1-Flash-Preview เองไม่มีอยู่ในแค็ตตาล็อกของเรา เส้นทางไปถึงมันคือ Token Plan และผลิตภัณฑ์เขียนโค้ดของผู้ขายเอง
สิ่งที่ทำให้บทความนี้เปลี่ยนไปนั้นเป็นเรื่องเฉพาะเจาะจงและง่ายต่อการเฝ้าดู ตารางราคาที่เปิดเผยสำหรับ MiniMax-M3.1-Flash-Preview จะทำให้เหตุผลหลักที่ทำให้ควรเลือก M3 ในแง่เศรษฐศาสตร์หมดไป ชุดคะแนนอิสระจะแทนที่คอลัมน์ว่างด้วยสิ่งที่เปรียบเทียบกันได้ เช็กพอยต์ที่ดาวน์โหลดได้จะขจัดข้อโต้แย้งเรื่องความสามารถในการทำซ้ำ จนกว่าอย่างน้อยหนึ่งในนั้นจะเกิดขึ้น MiniMax-M3 ยังคงเป็นโมเดลในคู่นี้ที่คุณสามารถทำให้ต้องรับผิดชอบได้ — และรุ่นใหม่กว่ายังคงเป็นพรีวิวที่เร็วกว่า ควบคุมได้ดีกว่า และยังไม่ถูกวัดผล ซึ่ง MiniMax ตัดสินใจคิดค่าบริการรายเดือนแทนการคิดตามโทเค็น

