
LongCat-2.5-Preview vs MiniMax M3: ที่นั่งราคาถูกถูกจองไปแล้ว
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 610 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 189 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
ข้อสันนิษฐานของการรายงานข่าวส่วนใหญ่เกี่ยวกับ LongCat-2.5-Preview คือ Meituan ได้ตัดราคาตลาด เมื่อเทียบกับ MiniMax M3ข้อสันนิษฐานนั้นก็สลายไปทันทีเมื่อได้สัมผัส. MiniMax M3 มีราคาอยู่ที่ $0.30 ต่อโทเค็นอินพุตหนึ่งล้านโทเค็น และ $1.20 ต่อโทเค็นเอาต์พุตหนึ่งล้านโทเค็นในแค็ตตาล็อกของเรา อัตราค่าบริการที่ประกาศของ LongCat-2.5-Preview คือ $0.30 ต่อโทเค็นอินพุตที่ไม่แคชหนึ่งล้านโทเค็น และ $1.20 ต่อโทเค็นเอาต์พุตหนึ่งล้านโทเค็น นั่นไม่ใช่ตัวเลขที่คล้ายกัน; มันเป็นตัวเลขเดียวกัน จุดเดียวที่พวกเขาแตกต่างกันคืออินพุตที่แคชไว้ โดย Meituan เสนอราคา $0.006 ต่อล้าน เทียบกับ $0.06 ของผู้ครองตลาด — ช่องว่างสิบเท่าในรายการที่ถูกที่สุดของบิล ดังนั้นคำถามที่น่าสนใจจึงไม่ใช่ว่า LongCat-2.5-Preview ถูกหรือไม่ แต่มันคือสิ่งที่คุณกำลังซื้อและสิ่งที่คุณต้องแลกไปเมื่อโมเดลใหม่มาพร้อมราคาที่เท่ากับผู้ครองตลาดเป๊ะ ๆ
คำตอบสั้น ๆ คือ เพดานเอาต์พุตที่สูงขึ้นมาก ฐานหลักฐานที่บางลงมาก และส่วนลดแคช
ราคาที่ประกาศเท่ากัน แต่เพดานที่ประกาศนั้นต่างกันมาก
MiniMax M3 เปิดเผยอย่างเป็นทางการตั้งแต่ 31 พฤษภาคม 2026 แคตตาล็อกของเรามีโมเดลนี้พร้อมหน้าต่างบริบท 1,048,576 โทเคน และเอาต์พุตสูงสุด 512,000 โทเคน — มากกว่าที่โมเดลส่วนใหญ่รองรับ และเป็นสี่เท่าของ 131,072 ของ LongCat-2.5-Preview โดยรับข้อความ รูปภาพ และวิดีโอเป็นอินพุต และส่งคืนข้อความ พร้อมเปิดให้ใช้งาน tool calling, JSON mode และ reasoning

LongCat-2.5-Preview ซึ่งระบุอยู่ในแพลตฟอร์ม LongCat API ของ Meituan เมื่อวันที่ 25 กันยายน 2026 ตรงกันที่บริบท 1,000,000 โทเค็น และต่ำกว่าเป้าอย่างมากที่เอาต์พุต 131,072 โปรไฟล์อินพุตของมันคือคำถามที่ยังไม่มีคำตอบ: changelog นำเสนอการเข้าใจภาพเป็นส่วนเพิ่มเติมที่เป็นไฮไลต์ แต่ตัวอย่างการตอบกลับในเอกสาร "Retrieve Model" ของ Meituan เองก็ยังแสดง input_modalities/ เป็น ["text"]/ โดยมี text->text/ สตริง modality MiniMax M3 ยังรองรับวิดีโอ ซึ่ง LongCat-2.5-Preview ไม่ได้อ้างว่าทำได้เลย หากไปป์ไลน์ของคุณป้อนการบันทึกหน้าจอหรือลำดับเฟรม การเปรียบเทียบนี้ก็จบลงตรงนี้
ความไม่สมมาตรของแคชกลับเป็นไปในทางตรงกันข้าม และควรกล่าวถึงในทางที่เป็นผลดีต่อ Meituan เพราะนี่คือมิติเดียวที่โมเดลใหม่สร้างความแตกต่างได้จริง $0.006 ต่ออินพุตที่แคชไว้หนึ่งล้านหน่วย เทียบกับ $0.06 ถือเป็นข้อได้เปรียบจริงสำหรับเวิร์กโหลดของเอเจนต์ที่ส่งคำนำหน้ายาวชุดเดิมซ้ำในทุกเทิร์น — ซึ่งเป็นเช่นนั้นกับงานส่วนใหญ่ และยังเป็นรายการที่มีแนวโน้มจะเปลี่ยนแปลงโดยไม่แจ้งให้ทราบมากที่สุด เนื่องจาก Meituan ระบุทั้งการ์ดว่าเป็นส่วนลดแบบจำกัดเวลา
ช่องว่างของหลักฐานที่วัดอย่างตรงไปตรงมาในทั้งสองทิศทาง
ตำแหน่งบน benchmark ของ MiniMax M3 ไม่แข็งแกร่ง และการพูดเช่นนั้นก็เป็นส่วนหนึ่งของการเปรียบเทียบนี้อย่างถูกต้อง Artificial Analysis บันทึก Coding Index ไว้ที่ 58.6 สำหรับมัน — เป็นอันดับที่ 46 ของโมเดลที่ติดตาม — และ Intelligence Index ที่ 29.2 ในอันดับที่ 60 GPQA Diamond 92.9%, Humanity's Last Exam 39%, SciCode 47.1%, Long-Context Recall 83, τ²-Bench banking 15.3, Terminal-Bench v2.1 65.2 ตัวเลขที่ MiniMax เผยแพร่เองครอบคลุมคนละส่วน: BrowseComp 83.5, GDPval rubrics 76.7, MCP Atlas 74.2, BankerToolBench 76.1 ตัวเลขเหล่านั้นเป็นตัวเลขที่ผู้ขายรายงานเอง และควรอยู่ในคอลัมน์ที่แยกจากตัวเลขอิสระ แต่พวกมันมีอยู่จริง ซึ่งคำว่า 'มีอยู่' นั่นแหละคือคำสำคัญ

LongCat-2.5-Preview ไม่มีคอลัมน์เลย ไม่มีตารางเปรียบเทียบประสิทธิภาพที่เผยแพร่ ไม่มีการ์ดโมเดล ไม่มีรายงานทางเทคนิค ไม่มีที่เก็บโค้ดบน HuggingFace หรือในองค์กร GitHub ของ Meituan และเมทาดาทาแคตตาล็อกที่บันทึกว่าน้ำหนักแบบเปิดเป็นเท็จ จำนวนพารามิเตอร์ทั้งหมดประมาณ 1.6 ล้านล้าน / ที่ใช้งาน 48,000 ล้านนั้นรายงานมาจากเมทาดาทาเว็บไซต์ของ Meituan และสื่อวงการค้าจีน มากกว่าที่จะมาจากเอกสารทางการ ดังนั้นข้อความที่ถูกต้องคือ: คะแนนของ M3 อยู่ในระดับปานกลางและมาจากแหล่งข้อมูลอิสระ ส่วนของ LongCat-2.5-Preview ไม่มีเลย โมเดลที่ได้คะแนนในช่วงสี่สิบต้น ๆ ในดัชนีการเขียนโค้ดเป็นปริมาณที่รู้จักและคุณสามารถวางแผนรับมือได้ โมเดลที่ไม่มีคะแนนเป็นความเสี่ยงอีกแบบหนึ่ง และการที่ราคาเท่ากันก็ตัดการชดเชยที่มักใช้เป็นเหตุผลในการเลือกใช้ออกไป
จุดที่ราคาเดียวกันเปลี่ยนสิ่งที่คุณควรทำ
เมื่อโมเดลใหม่ตัดราคาทั้งวงการ สิ่งที่สมเหตุสมผลคือการประเมินมัน — ข้อได้เปรียบคือส่วนลดที่แท้จริง เมื่อโมเดลใหม่เปิดตัวในราคาเท่ากับรุ่นที่ครองตลาดซึ่งวางจำหน่ายมาตั้งแต่เดือนพฤษภาคม ข้อได้เปรียบไม่ใช่ราคา แต่มันคือความสามารถ และความสามารถคือสิ่งเดียวที่ LongCat-2.5-Preview ยังไม่ได้เปิดเผย นั่นทำให้การประเมินเปลี่ยนกรอบไปทั้งหมด คุณไม่ได้ทดสอบว่ามันถูกกว่าหรือไม่ แต่คุณกำลังทดสอบว่ามันดีกว่าหรือไม่ บนงานของคุณ จากการเริ่มต้นจากศูนย์โดยไม่มีหลักฐานให้ยึดเหนี่ยว
มีรายละเอียดระดับรองอยู่อย่างหนึ่งที่ทำให้การทดสอบนั้นถูกกว่าที่ดูเหมือน LongCat-2.5-Preview ฟรีและไม่จำกัดผ่าน OpenCode ในช่วงเวลาหนึ่งที่ไม่ได้ระบุความยาวไว้ โดยมีนโยบายไม่เก็บข้อมูลใดเลย (zero-retention) ที่ OpenCode ระบุไว้อย่างชัดเจน — การฝึกโมเดล "Not used" การเก็บข้อมูล "0 days" เทียบกับสามสิบวันของรายการเปรียบเทียบ ดังนั้นต้นทุนในการสร้างชุดประเมินของคุณเองจึงเกือบเป็นศูนย์ และนโยบายการเก็บข้อมูลหมายความว่าคุณสามารถรันมันกับโค้ดส่วนตัวได้ รายละเอียดของฮาร์เนสอย่างหนึ่งที่ต้องจัดการก่อนคือ โมเดลจะคืนร่องรอยการให้เหตุผลของมันแบบสลับไปมาใน reasoning_content/ ฟิลด์; ไคลเอนต์ที่แยกวิเคราะห์ chat completions โดยไม่คาดคิดว่าจะเจอฟิลด์นี้จะทิ้งส่วนการคิดไปอย่างเงียบ ๆ และทำให้โมเดลดูแย่กว่าที่เป็นจริง

ข้อโต้แย้งเรื่องการจัดเส้นทาง ซึ่งเฉพาะเจาะจงสำหรับการเปรียบเทียบในราคาเดียวกัน
เราให้บริการ MiniMax M3 ในราคาที่ MiniMax กำหนด โดยไม่มีค่าบวกเพิ่มเลย LongCat-2.5-Preview ไม่ใช่หนึ่งในเส้นทางให้บริการของเรา — เราไม่ได้ให้บริการโมเดลนี้ และไม่มีข้อความใดที่นี่ที่ควรถูกตีความว่าเป็นการอ้างเป็นอย่างอื่น
การจับคู่ที่ราคาเท่ากันเป็นกรณีที่การกำหนดเส้นทางคุ้มค่าจริง ๆ ไม่ใช่แค่ความสะดวก ถ้าโมเดลสองตัวมีต้นทุนเท่ากัน การตัดสินใจเลือกระหว่างทั้งสองเป็นรายคำขอและต่องาน: M3 สำหรับเพดานเอาต์พุต 512,000 โทเคนและอินพุตวิดีโอ, LongCat-2.5-Preview สำหรับส่วนลดแบบ cached-prefix ในลูปเอเจนต์ที่ยาวนาน เมื่อคุณมั่นใจในคุณภาพของมันแล้ว การหลอมรวมโมเดลคือกลไกที่ทำให้เรื่องนั้นเป็นจริงอย่างแท้จริง — การดึงข้อมูลหนึ่งรอบและขั้นตอนการสังเคราะห์สามารถใช้โมเดลคนละตัวได้ในคำขอเดียว ดังนั้นคุณจึงไม่ถูกบังคับให้เลือกผู้ชนะก่อนที่คุณจะมีหลักฐาน และเนื่องจากเราส่งผ่านราคาตามรายการของผู้ให้บริการโดยไม่บวกราคาเพิ่ม การเปลี่ยนแปลงอัตราของผู้ขายจึงปรากฏบนบิลของคุณในวันเดียวกัน แทนที่จะเป็นตอนต่อสัญญาครั้งถัดไป ซึ่งสำคัญกว่าปกติเมื่อหนึ่งในสองการ์ดนั้นเป็นโปรโมชันอย่างชัดเจน จากนั้น Automatic failover จะครอบคลุมกรณีที่ผู้ให้บริการรายหนึ่งมีประสิทธิภาพลดลง และสิ่งนี้สำคัญที่สุดสำหรับโมเดลที่ไม่มีประวัติการให้บริการให้ตรวจสอบ
ถามบ่อย
• LongCat-2.5-Preview ถูกกว่า MiniMax M3 ไหม? ไม่ ในการ์ดราคาที่เผยแพร่ อัตราอินพุตและเอาต์พุตเท่ากันที่ $0.30 และ $1.20 ต่อล้าน ข้อได้เปรียบด้านราคาเพียงอย่างเดียวอยู่ที่อินพุตแคช $0.006 เทียบกับ $0.06 และ Meituan ระบุว่าการ์ดราคาทั้งหมดของตนเป็นส่วนลดชั่วคราว โดยไม่บอกว่าหลังจากนั้นจะเป็นอย่างไร
• อันไหนมีเอาต์พุตที่ใช้งานได้มากกว่ากัน? MiniMax M3 ชนะขาดลอย: 512,000 โทเคน เทียบกับ 131,072 สำหรับการสร้างเนื้อหารูปแบบยาว การสกัดข้อมูลแบบมีโครงสร้างจากเอกสารขนาดใหญ่ หรืออะไรก็ตามที่เขียนยาวเกินหนึ่งบท เพดานนี้คือสเปกที่ชี้ขาด
• อันไหนที่ฉันตรวจสอบได้? MiniMax M3 และการตรวจสอบก็ไม่ได้ทำให้มันดูดีขึ้นเลย — Coding 58.6 อยู่อันดับที่สี่สิบหก และ Intelligence Index อยู่ที่ 29.2 อยู่อันดับที่หกสิบจาก Artificial Analysis ส่วน LongCat-2.5-Preview ไม่มีผลการประเมินที่เผยแพร่จากใครเลย หากมี benchmark ของ LongCat-2.5-Preview ปรากฏขึ้นในสัปดาห์นี้ ให้ถือว่ายังตรวจสอบไม่ได้ จนกว่าคุณจะสืบหาไปถึงผู้ประเมินที่มีชื่อได้
• ควรเอาตัวไหนขึ้นโปรดักชัน? ไม่เอาสักตัวถ้ายังไม่ได้ทดสอบด้วยตัวเอง ระหว่างสองตัวนี้ M3 เป็นทางเลือกที่มีความแปรปรวนต่ำกว่า เพราะจุดอ่อนของมันมีเอกสารระบุไว้ชัดเจน และรูปแบบอินพุตของมันได้รับการยืนยันแล้ว ส่วน LongCat-2.5-Preview เป็นตัวที่มีความแปรปรวนสูงกว่า โดยอ้างขนาดบริบทได้ใหญ่กว่า เพดานเอาต์พุตเล็กกว่ามาก มีส่วนลดค่าแคช และไม่มีหลักฐานสาธารณะเลย ลองใช้แบบฟรีระหว่างที่หน้าต่างยังเปิดอยู่ เก็บทั้งสองตัวไว้หลัง คีย์เดียว แล้วให้ตัวเลขของคุณเองเป็นตัวตัดสิน
