
MiniMax M3 vs Muse Spark 1.2: ช่องว่างราคา 4 เท่าต่อการกวาดเรียบทุกBenchmark
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MiniMax M3 มีราคา 0.30 ดอลลาร์ต่อโทเคนอินพุตหนึ่งล้านโทเคนในแค็ตตาล็อกของเรา Muse Spark 1.2 มีราคา 1.25 ดอลลาร์ นั่นคือช่องว่าง 4.2 เท่าในด้านอินพุต และ 3.5 เท่าในด้านเอาต์พุต และมันเป็นข้อเท็จจริงที่มีประโยชน์ที่สุดเพียงหนึ่งเดียวเกี่ยวกับการจับคู่นี้ เพราะบนหน้าแค็ตตาล็อกเดียวกัน Muse Spark 1.2 นำหน้า MiniMax M3 ในทุกแถวของเบนช์มาร์กที่ทั้งสองโมเดลมีร่วมกัน ตัวหนึ่งเป็นตัวเลือกน้ำหนักเปิดราคาถูกที่ผู้ขายรับประกันบริบทใช้งานได้ 512K และเพดานเอาต์พุต 512K อีกตัวเป็นเช็กพอยต์การให้เหตุผลของ Meta ที่ตอนนี้ล้าหลังรุ่นในตระกูลของตัวเองไปหนึ่งรุ่น และยังคงทำคะแนนได้สูงกว่าในแทบทุกที่ ส่วนที่เหลือของหน้านี้ว่าด้วยว่าข้อเท็จจริงสองข้อนั้นข้อไหนกันแน่ที่ตัดสินเวิร์กโหลด — และคำตอบไม่เหมือนกันสำหรับทุกเวิร์กโหลด
จริง ๆ แล้วแต่ละโมเดลเหล่านี้คืออะไร
ทั้งคู่เปิดตัวไปแล้วในปีนี้ และไม่มีอันไหนใหม่เลย นั่นสำคัญ เพราะหน้าสำหรับเปรียบเทียบที่เขียนขึ้นมาราวกับว่าอันใดอันหนึ่งกำลังเปิดตัว จะทำให้ตัวมันเองกลายเป็นของล้าสมัยไปภายในหนึ่งเดือน

MiniMax M3 เป็นการเปิดตัวของ MiniMax เอง ประกาศบนบล็อกของผู้พัฒนาเมื่อวันที่ 2026-06-01 ภายใต้พาดหัวข่าว "MiniMax M3: การเขียนโค้ดระดับแนวหน้า, บริบท 1M, มัลติโมดัลแบบเนทีฟ — ทั้งหมดในโมเดลเดียว" โพสต์เปิดขึ้นอย่างตรงไปตรงมา: "MiniMax M3 เปิดตัวอย่างเป็นทางการแล้ววันนี้" คำกล่าวอ้างสามประการของ MiniMax สำหรับมันคือ มันมีประสิทธิภาพระดับแนวหน้าในงานเขียนโค้ดและงานเอเจนต์, มันใช้ MSA (MiniMax Sparse Attention) ซึ่งเป็นสถาปัตยกรรม attention ใหม่ที่บริษัทเสนอ, และมันเป็นมัลติโมดัลแบบเนทีฟ — มันรับอินพุตรูปภาพและวิดีโอ และในคำพูดของ MiniMax "สามารถควบคุมคอมพิวเตอร์เดสก์ท็อปได้" MiniMax เสริมว่าความสามารถทั้งสามนี้เป็นสิ่งจำเป็นขั้นพื้นฐานสำหรับโมเดลระดับแนวหน้าแบบปิดซอร์ส และ M3 เป็น "โมเดลโอเพนเวทตัวแรกและตัวเดียวที่รวมทั้งสามเข้าด้วยกัน" แคตตาล็อกของเราระบุว่าโมเดลนี้พร้อมใช้งานตั้งแต่ 2026-05-31 ซึ่งเป็นหนึ่งวันก่อนวันที่ในบล็อก
Muse Spark 1.2 เป็นของ Meta แค็ตตาล็อกของเราระบุวันที่ไว้ที่ 2026-08-05 มันไม่ใช่ระดับใหม่ — แต่เป็นเช็กพอยต์ที่อัปเดตจาก Muse Spark 1.1 โดยมีประสิทธิภาพสูงขึ้นเล็กน้อย ให้บริการบนระดับ Standard เดียวกันในราคาเดียวกัน ซึ่งทำให้เป็นการอัปเกรดแบบแทนที่ได้ทันที มากกว่าจะเป็นผลิตภัณฑ์แยกต่างหาก จุดเด่นที่แตกต่างคืออินพุตที่รองรับ: ข้อความ รูปภาพ วิดีโอ เสียง และ PDF เอาต์พุตเป็นข้อความ
ข้อมูลบริบทหนึ่งอย่างควรอยู่ตรงนี้ ดีกว่าจะถูกซ่อนไว้ในภายหลัง Meta ได้ขยับตระกูล Muse Spark ไปสู่เช็กพอยต์ 1.3 เมื่อ 2026-09-02 ซึ่งทำให้ 1.2 กลายเป็นรุ่นก่อนหน้าของสายผลิตภัณฑ์เดียวกัน เหตุการณ์นั้นเกิดขึ้นเมื่อสามสัปดาห์ก่อน จึงไม่ใช่ข่าว และหน้านี้ไม่ได้ถือว่ามันเป็นข่าว — แต่ใครก็ตามที่กำลังเลือกระหว่างสองรุ่นนี้ในวันนี้ ควรรู้ว่าพวกเขากำลังเปรียบเทียบโมเดล MiniMax รุ่นปัจจุบันกับโมเดล Meta ที่ถูกแทนที่แล้ว
ราคาต่อโทเคนหนึ่งล้านตัว และค่าใช้จ่ายจริงของเวิร์กโหลดหนึ่งงาน

อัตราที่ประกาศไว้ ซึ่งนำมาจากหน้าของแต่ละโมเดลในแคตตาล็อกของเราเอง ซึ่งส่งผ่านราคาตามรายการของผู้ให้บริการโดยไม่มีการบวกเพิ่ม:
• อินพุต — MiniMax M3 $0.30 ต่อ 1 ล้านโทเคน เทียบกับ Muse Spark 1.2 $1.25 ต่อ 1 ล้านโทเคน
• เอาต์พุต — MiniMax M3 $1.20 ต่อ 1M เทียบกับ Muse Spark 1.2 $4.25 ต่อ 1M
• การอ่านแคช — MiniMax M3 $0.060 ต่อ 1M เทียบกับ Muse Spark 1.2 $0.150 ต่อ 1M
• อัตราส่วน — Muse Spark 1.2 อยู่ที่ 4.2 เท่าสำหรับอินพุต, 3.5 เท่าสำหรับเอาต์พุต, 2.5 เท่าสำหรับการอ่านแคช
อัตราส่วนเชิงนามธรรมเหล่านั้นกลายเป็นรูปธรรมในเครื่องคำนวณต้นทุนบนแต่ละหน้า ตั้งค่าทั้งคู่เป็น 10 ล้านโทเคนต่อเดือน โดยมีสัดส่วนอินพุต 70% — ซึ่งเป็นรูปแบบที่สมเหตุสมผลสำหรับงานสรุปหรือสกัดข้อมูล และเป็นค่าเริ่มต้นที่เครื่องประเมินให้มา — แล้ว MiniMax M3 จะออกมาอยู่ที่ $5.70 ต่อเดือน Muse Spark 1.2 จะออกมาอยู่ที่ $11.30 ต่อเดือน เปิดใช้ prompt caching แล้วงานเดียวกันจะอยู่ที่ประมาณ $4.86 เทียบกับประมาณ $9.63 เครื่องคำนวณระบุทั้งคู่เป็นค่าประมาณโดยอิงจากราคาตามรายการ ซึ่งเป็นข้อควรระวังที่ถูกต้อง: จำนวนโทเคนจริงขึ้นอยู่กับ tokenizer ของผู้ให้บริการ
สำหรับเวิร์กโหลดราคาถูก ช่องว่างก็แค่เงินค่ากาแฟเท่านั้น ประเด็นอยู่ที่รูปทรงของเส้นโค้ง ไม่ใช่ค่าสัมบูรณ์: เวิร์กโหลดที่มีโทเคนเอาต์พุตจำนวนมากหนึ่งร้อยล้านโทเคนต่อเดือนจะข้ามจากหลักสามไปหลักสี่เฉพาะฝั่ง Muse Spark เพียงอย่างเดียว หากต้นทุนเป็นข้อจำกัดที่ทำให้คุณมาพิจารณาการจับคู่นี้ นั่นคือตัวเลขที่คุณควรจำลองบนทราฟฟิกของคุณเอง
เนื่องจากเราส่งผ่านราคาตามรายการของผู้ให้บริการโดยตรงโดยไม่บวกกำไร การลดราคาของผู้ขายจึงปรากฏบนฝั่งของเราในวันเดียวกับที่ประกาศ และโมเดลทั้งสองนี้ถูกส่งเส้นทางมาที่นี่ — คีย์เดียวครอบคลุมทั้งคู่ ดังนั้นการกำหนดราคาให้แข่งขันกันจึงไม่จำเป็นต้องมีสัญญาที่สองหรือการแก้ไขโค้ด
หน้าต่างบริบท และสิ่งที่บรรจุอยู่ในนั้นได้จริง
นี่คือส่วนที่ทั้งสองดูคล้ายกันมากที่สุดในสเปกชีต และคล้ายกันน้อยที่สุดในการใช้งานจริง
• หน้าต่างบริบท — MiniMax M3 1,048,576 โทเค็น เทียบกับ Muse Spark 1.2 1,048,576 โทเค็น
• เอาต์พุตสูงสุด — MiniMax M3 512,000 โทเค็น เทียบกับ Muse Spark 1.2 131,072 โทเค็น
อินพุตที่รองรับ — MiniMax M3 รองรับข้อความ รูปภาพ และวิดีโอ เทียบกับ Muse Spark 1.2 รองรับข้อความ รูปภาพ วิดีโอ เสียง และ PDF
• พื้นผิวเอาต์พุต — ทั้งคู่ส่งเฉพาะข้อความ
• พารามิเตอร์แบบมีโครงสร้าง — MiniMax M3 เปิดให้ใช้ tools และ tool_choice; Muse Spark 1.2 เปิดให้ใช้ reasoning_effort และ structured_outputs
หน้าต่างบริบททั้งสองเท่ากันที่หนึ่งล้านโทเค็น ดังนั้นคำถามที่ว่า "ใครมีบริบทมากกว่า" จึงไม่มีผู้ชนะ แถวเอาต์พุตสูงสุดคือจุดที่ทั้งสองต่างกัน คำตอบจาก MiniMax M3 ทำได้ถึง 512,000 โทเค็น ซึ่งประมาณสี่เท่าของเพดาน 131,072 ของ Muse Spark 1.2 ถ้างานของคุณเป็นการสร้างเนื้อหายาว — การเขียนไฟล์ใหม่ทั้งไฟล์ รายงานยาว เอาต์พุตระดับบทถอดความ — ความแตกต่างนั้นเป็นเชิงโครงสร้าง ไม่ใช่แค่ส่วนเพิ่ม ถ้างานของคุณเป็นคำตอบสั้น ๆ เหนืออินพุตยาว มันก็ไม่เกี่ยวอะไร
แถวเกี่ยวกับอินพุตที่รองรับกลับให้ผลตรงกันข้าม Muse Spark 1.2 รองรับเสียงและ PDF โดยตรง ส่วนขอบเขตอินพุตตามเอกสารของ MiniMax M3 หยุดอยู่แค่รูปภาพและวิดีโอ ไปป์ไลน์ที่นำเข้าบันทึกการสนทนาหรือเอกสารสแกนจึงมีปริมาณการประมวลผลล่วงหน้าที่ต้องทำแตกต่างกันสำหรับสองตัวนี้
ในฝั่ง MiniMax ข้ออ้างเรื่องคอนเท็กซ์มีบันทึกเชิงสถาปัตยกรรมที่ควรติดป้ายกำกับให้ชัดเจนว่าเป็นของผู้ขายเอง MiniMax อ้างว่าพฤติกรรมบริบทแบบยาวของ M3 เกิดจาก MSA (MiniMax Sparse Attention) ซึ่งแคตตาล็อกของเราระบุว่าอธิบายว่ารองรับบริบทได้ถึง 1M โทเคน "โดยมีขั้นต่ำที่รับประกันไว้ที่ 512K" กรอบความคิดเรื่องขั้นต่ำที่รับประกันนี้เป็นของ MiniMax เอง เราไม่มีผลการวัดที่เป็นอิสระให้อ้างอิงได้ ดังนั้นให้ถือว่าพื้นขั้นต่ำ 512K เป็นข้ออ้างของผู้ขาย มากกว่าจะเป็นตัวเลขที่ผ่านการทดสอบ
ความหน่วงและปริมาณงานบนเกตเวย์ของเราเอง
นี่คือตัวเลขที่เราสามารถพูดถึงได้โดยตรงที่สุด เพราะเป็นตัวเลขของเราเอง ครอบคลุมเจ็ดวันถึงวันที่ 2026-09-23 และอธิบายทราฟฟิกบนเกตเวย์ของเรา ไม่ใช่เกณฑ์มาตรฐานจากผู้ขาย
• เวลา p50 ถึงโทเคนแรก — MiniMax M3 4.28 วินาที เทียบกับ Muse Spark 1.2 4.82 วินาที
• p95 ระยะเวลาถึงโทเค็นแรก — MiniMax M3 10.00 วินาที เทียบกับ Muse Spark 1.2 10.00 วินาที
• ความเร็วในการส่งออก — MiniMax M3 289 tok/s เทียบกับ Muse Spark 1.2 507 tok/s
• อัตราข้อผิดพลาด — MiniMax M3 0.12% เทียบกับ Muse Spark 1.2 0.15%
• ทราฟฟิก 7 วันล่าสุด — MiniMax M3 153.8M โทเคน เทียบกับ Muse Spark 1.2 79.6M โทเคน
อ่านอย่างตรงไปตรงมาแล้ว ภาพที่ได้จะแยกเป็นสองด้าน ในด้านเวลาถึงโทเคนแรก ทั้งสองใกล้กัน — ค่ามัธยฐานอยู่ที่ 4.28 เทียบกับ 4.82 วินาที และค่า p95 เท่ากันถึงทศนิยมตำแหน่งที่สองที่ 10.00 วินาที ซึ่งเป็นผลจากการปัดเศษเพราะทั้งคู่อยู่ใกล้เพดานเดียวกัน มากกว่าจะเป็นความเท่ากันจริง ในด้านความเร็วเอาต์พุต ทั้งสองไม่ได้ใกล้กันเลย: Muse Spark 1.2 สตรีมด้วยอัตราราว 1.75 เท่าของ MiniMax M3 ซึ่งเปลี่ยนความรู้สึกของการสร้างผลลัพธ์ยาว ๆ สำหรับผู้ใช้ที่เฝ้าดู แม้ว่าต้นทุนรวมจะสูงกว่า อัตราข้อผิดพลาดของทั้งสองต่างกันเพียงเศษเสี้ยวจากการปัดเศษ และทั้งคู่ล้วนต่ำ
แถวข้อมูลทราฟฟิกนั้นคุ้มค่าที่จะอ่านในฐานะสัญญาณ มากกว่าจะเป็นกระดานคะแนน: ในช่วงเจ็ดวันเดียวกัน MiniMax M3 ประมวลผลโทเคนได้ประมาณสองเท่าของที่ Muse Spark 1.2 ทำได้บนเกตเวย์ของเรา นั่นคือสิ่งที่ตลาดกำลังเลือก ไม่ใช่สิ่งที่เบนช์มาร์กบอก และในการจับคู่นี้ ทั้งสองเห็นไม่ตรงกัน
การกำหนดเส้นทางทั้งสองไว้หลังปลายทางเดียวก็เป็นวิธีที่ประหยัดในการค้นหาว่าเวิร์กโหลดของคุณชอบแบบใดมากกว่า เพราะการสลับสำรองเมื่อขัดข้องหมายความว่าการเสื่อมประสิทธิภาพฝั่งผู้ให้บริการบนโมเดลใดโมเดลหนึ่งจะตกไปยังเส้นทางที่ทำงานได้แทนที่จะกลายเป็นข้อผิดพลาด
การเรียกใช้เครื่องมือและงานแบบเอเจนต์ระยะยาว
นี่คือจุดที่ทั้งสองแตกต่างกันมากที่สุดในผลลัพธ์ที่วัดได้ และเป็นจุดที่ข้อควรระวังมีความสำคัญมากที่สุด
• Terminal-Bench v2.1 — MiniMax M3 52.4 กับ Muse Spark 1.2 80.1
• tau_banking (การใช้เครื่องมือ) — MiniMax M3 12.3 vs Muse Spark 1.2 34.8
• MCP Atlas — MiniMax M3 74.2 (ตามที่ผู้ขายรายงาน) เทียบกับ Muse Spark 1.2 ยังไม่ได้วัด
• BrowseComp — MiniMax M3 83.5 (รายงานโดยผู้จำหน่าย) เทียบกับ Muse Spark 1.2 ที่ยังไม่ได้วัด
• OSWorld-Verified — MiniMax M3 70.0 (ตามที่ผู้จำหน่ายรายงาน) เทียบกับ Muse Spark 1.2 ที่ยังไม่ได้วัด
สองแถวแรกมาจากแผงเกณฑ์มาตรฐานบนหน้าคาตาล็อกของเราเอง และเป็นแถวแบบเอเจนต์เพียงแถวเดียวที่ทั้งสองโมเดลได้กรอกข้อมูลไว้ ห่างกันไม่น้อย: Muse Spark 1.2 ทำคะแนนบน tau_banking ได้มากกว่าสองเท่าของ MiniMax M3 และนำ Terminal-Bench v2.1 อยู่เกือบ 28 คะแนน หากเวิร์กโหลดของคุณเป็นเอเจนต์ระยะยาวที่มีพื้นผิวเครื่องมือ นั่นคือช่องว่างเดี่ยวที่ใหญ่ที่สุดในหน้านี้
สามแถวถัดไปเป็นตัวเลขของ MiniMax เอง ที่เผยแพร่ในโพสต์เปิดตัว พวกมันเทียบกับสองแถวแรกไม่ได้ — ใช้ฮาร์เนสต่างกัน ไม่มีการตรวจสอบอิสระ — แต่พวกมันเป็นตัวเลขที่เผยแพร่เพียงชุดเดียวสำหรับ MiniMax M3 ในงานเหล่านั้น ดังนั้นการไม่ใส่พวกมันไว้จะทำให้ประเมินโมเดลต่ำเกินไป ให้อ่านเป็นข้อมูลที่ผู้ขายรายงานเท่านั้น ไม่มากไปกว่านั้น
ความคลาดเคลื่อนหนึ่งจุดสมควรได้รับย่อหน้าของตัวเอง เพราะมันเป็นประเภทของสิ่งทีหน้าสำหรับเปรียบเทียบมักกลบเกลื่อนไว้ โพสต์เปิดตัวของ MiniMax แสดง Terminal-Bench 2.1 ที่ 66.0 สำหรับ M3 ภายในภาพแผนภูมิโดยไม่มีตารางตัวเลขประกอบ ส่วนแถว Terminal-Bench v2.1 จากแหล่งอิสระบนหน้าคาตาล็อกของเราแสดง 52.4 สำหรับโมเดลเดียวกัน ชื่อภารกิจใกล้เคียงกันมากพอที่ผู้อ่านจะพบเห็นทั้งสองเคียงข้างกัน และตัวเลขทั้งสองต่างกันเกิน 13 จุด เราจะไม่ประกาศว่าอันใดอันหนึ่งผิด คำอธิบายที่เป็นไปได้คือใช้ฮาร์เนสต่างกันหรือการตั้งค่าการรันต่างกัน และคำกล่าวที่ซื่อตรงคือตัวเลขของผู้ขายเองกับตัวเลขที่ตรวจสอบแล้วไม่ตรงกัน โดยตัวเลขของผู้ขายสูงกว่า
รายการพารามิเตอร์บอกเรื่องราวที่เล็กลงและใช้งานได้จริงมากขึ้น MiniMax M3 เปิดให้ใช้ tools และ tool_choice ดังนั้นการเลือกเครื่องมือจึงควบคุมทิศทางได้จากคำขอ Muse Spark 1.2 เปิดให้ใช้ reasoning_effort ดังนั้นความลึกของการให้เหตุผลจึงควบคุมทิศทางได้แทน ทั้งสองไม่ได้เปิดเผยปุ่มปรับของอีกฝ่าย หากปัญหาการควบคุมของแอปพลิเคชันคุณคือ "ทำให้มันเรียกฟังก์ชันที่ถูกต้อง" นั่นชี้ไปทางหนึ่ง หากเป็น "ทำให้มันคิดนานขึ้นในกรณีที่ยาก" นั่นชี้ไปอีกทาง
การเขียนโค้ด
การเขียนโค้ดเป็นคำกล่าวอ้างหลักของ MiniMax M3 และเป็นจุดที่ช่องว่างที่วัดได้นั้นดูน่าอึดอัดที่สุดสำหรับมัน
• AA Coding Index — MiniMax M3 38.7 กับ Muse Spark 1.2 72.2
• SciCode — MiniMax M3 43.1 กับ Muse Spark 1.2 57.4
• SWE-Bench Pro — MiniMax M3 59.0 (ตามข้อมูลที่ผู้ขายรายงาน) เทียบกับ Muse Spark 1.2 ยังไม่ได้วัด
• KernelBench Hard — MiniMax M3 28.8 (ตามที่ผู้ขายรายงาน) เทียบกับ Muse Spark 1.2 ที่ยังไม่ได้วัด
จุดยืนของ MiniMax สำหรับ M3 คือให้ความสำคัญกับการเขียนโค้ดเป็นอันดับแรก — พาดหัวเปิดตัวยก "Frontier Coding" ขึ้นมาก่อนบริบทระดับล้านโทเคนและความสามารถมัลติโมดัล ตัวเลข SWE-Bench Pro ที่ทางบริษัทรายงานเองที่ 59.0 ถือเป็นตัวเลขที่แข็งแกร่งบนฮาร์เนสของผู้ขายรายนั้น อย่างไรก็ตาม ในแถว Coding Index และ SciCode ของฝ่ายอิสระที่ทั้งสองโมเดลมีข้อมูลกรอกไว้ Muse Spark 1.2 นำอยู่ห่างพอสมควร และช่องว่างใน Coding Index ที่ 33 คะแนนถือเป็นช่องว่างที่ใหญ่เป็นอันดับสองในหน้านี้ รองจาก tau_banking
ไม่มีวิธีที่ซื่อสัตย์ใดๆ ในการนำเสนอ MiniMax M3 ว่าเป็นโมเดลเขียนโค้ดที่ดีกว่าโดยอ้างอิงจากหลักฐานที่มีอยู่ สิ่งที่กล่าวได้คือ ตัวเลขการเขียนโค้ดของผู้ขายเองนั้นสูง แต่ตัวเลขจากแหล่งอิสระกลับไม่สูง ในรูปแบบเดียวกันกับความคลาดเคลื่อนของ Terminal-Bench ข้างต้น ใครก็ตามที่การตัดสินใจขึ้นอยู่กับการเขียนโค้ด ควรให้น้ำหนักกับแถวข้อมูลที่ผ่านการตรวจสอบมากกว่ากราฟจากโพสต์เปิดตัว และควรทดสอบบนที่เก็บโค้ดของตนเอง แทนที่จะอาศัยข้อมูลใดข้อมูลหนึ่งจากสองแหล่งนั้น
ตรงที่พวกมันใกล้กันอย่างแท้จริง
สามแถวไม่ยอมให้ผู้ชนะ และการบอกตามตรงเช่นนั้นมีประโยชน์กว่าการสร้างผู้ชนะขึ้นมาเอง
• GPQA Diamond — MiniMax M3 89.9 เทียบกับ Muse Spark 1.2 90.4 ช่องว่าง 0.5 คะแนนซึ่งถือเป็นผลเสมอกันสำหรับจุดประสงค์ในทางปฏิบัติใด ๆ
• p95 เวลาถึงโทเคนแรก — ทั้งคู่ 10.00 วินาที ตลอดเจ็ดวันที่ผ่านมาบนเกตเวย์ของเรา
• หน้าต่างบริบทและรูปแบบเอาต์พุต — เหมือนกันที่ 1,048,576 โทเค็นอินพุต และเอาต์พุตแบบข้อความเท่านั้น
ในด้านการให้เหตุผลทางวิทยาศาสตร์ระดับบัณฑิตศึกษา ทั้งสองแทบจะแยกไม่ออก และนั่นคือแถวการให้เหตุผลเพียงแถวเดียวที่โมเดลราคาถูกกว่ามากของ MiniMax M3 ยืนหยัดสู้กับโมเดลที่แพงกว่าได้ เป็นเรื่องที่ควรจดจำเมื่ออ่านดัชนีรวม: ช่องว่างระหว่างโมเดลเหล่านี้ไม่สม่ำเสมอในแต่ละความสามารถ โดยกระจุกตัวอยู่ในงานด้านเอเจนต์และงานเขียนโค้ด และแทบจะเป็นศูนย์ในข้อสอบปรนัยที่เน้นความรู้

เลือก MiniMax M3 ถ้า เลือก Muse Spark 1.2 ถ้า
ข้อเท็จจริงสองข้อจากย่อหน้าเปิดให้ผลที่แตกต่างกันไป ขึ้นอยู่กับว่าคุณกำลังสร้างอะไร ดังนั้นนี่คือการแบ่งแยกโดยไม่กำกวม
• เลือก MiniMax M3 หากต้นทุนต่อโทเค็นเป็นข้อจำกัดที่ผูกมัด หากคุณต้องการเอาต์พุตรูปแบบยาวที่เกิน 131,072 โทเค็น หากคุณต้องการเวทเปิด หากคุณต้องการอินพุตวิดีโอโดยไม่ต้องมีไปป์ไลน์แยก หรือหากคุณต้องการงานองค์ความรู้ที่ใช้การให้เหตุผลหนักๆ ในราคาประมาณหนึ่งในสี่ของราคาอินพุต — GPQA Diamond สูสีกันมาก และนั่นคือแถวที่โมเดลราคาถูกพิสูจน์คุณค่าของตัวเอง
• เลือก Muse Spark 1.2 หากเวิร์กโหลดของคุณเป็นเอเจนต์ระยะยาวที่มีเครื่องมือ หากคุณต้องการคะแนนการเขียนโค้ดที่ผ่านการตรวจสอบสูงสุด หากคุณต้องการปุ่มปรับ reasoning_effort ที่ชัดเจน หากคุณจำเป็นต้องนำเข้าข้อมูลเสียงหรือ PDF โดยตรง หรือหากคุณต้องการเอาต์พุตแบบสตรีมมิ่งที่รวดเร็ว — 507 tok/s เทียบกับ 289 tok/s เป็นความแตกต่างที่มองเห็นได้ ไม่ใช่ความแตกต่างจากเบนช์มาร์ก
• หากคุณยังไม่ทราบว่าควรเลือกโมเดลใด หลักฐานที่ใช้ชี้ขาดไม่ได้อยู่บนหน้านี้ ลองนำทั้งสองโมเดลไปทดสอบกับตัวอย่างทราฟฟิกของคุณเองแล้ววัดผลดู เครื่องคำนวณราคาบนหน้าโมเดลแต่ละหน้าจะบอกข้อมูลด้านต้นทุนให้คุณได้ภายในหนึ่งนาที และตัวเลขความหน่วงระยะเจ็ดวันข้างต้นก็เป็นสิ่งที่ใกล้เคียงที่สุดที่จะช่วยให้เห็นภาพล่วงหน้าของด้านประสิทธิภาพ
ทั้งสองอย่างอยู่บน API เดียวกัน โดยไม่มีการบวกเพิ่มจากราคาที่ผู้ให้บริการตั้งไว้ ดังนั้นการทดลองใช้จึงเป็นการเปลี่ยน model-id มากกว่าการย้ายระบบ และ การ failover อัตโนมัติหมายความว่าวันที่ผู้ให้บริการรายใดรายหนึ่งมีปัญหา จะกลายเป็นคำตอบที่ช้าลงแทนที่จะเป็นการล่ม.
การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
