
LongCat-2.5-Preview vs GLM-5.2: สองหน้าต่าง 1M โทเคน หนึ่งในนั้นวัดผลแล้ว
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 610 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 189 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
LongCat-2.5-Preview และ GLM-5.2มีตัวเลขพาดหัวเดียวกัน: หน้าต่างบริบทขนาดหนึ่งล้านโทเค็น ความบังเอิญเพียงอย่างเดียวนี้กำลังทำหน้าที่ทั้งหมดในการเปรียบเทียบส่วนใหญ่ที่ถูกเขียนขึ้นในสัปดาห์นี้ และมันไม่เพียงพอที่จะใช้เปรียบเทียบสองโมเดล GLM-5.2 เป็นที่บันทึกไว้ตั้งแต่ 16 มิถุนายน 2026 โดยมีโปรไฟล์เบนช์มาร์กสาธารณะ, อัตราค่าบริการที่เผยแพร่ และคะแนนการเรียกคืนบริบทยาวจากผู้ประเมินอิสระ LongCat-2.5-Preview ปรากฏบนแพลตฟอร์ม LongCat API ของ Meituan เมื่อวันที่ 25 กันยายน 2026 พร้อมกับอัตราค่าบริการส่วนลด, จำนวนพารามิเตอร์ที่รายงานโดยสื่อจีน และไม่มีเบนช์มาร์กที่เผยแพร่ใดๆ เลย หน้าต่างหนึ่งถูกวัด อีกหน้าต่างหนึ่งถูกกล่าวอ้าง ทุกสิ่งด้านล่างแยกสองหมวดหมู่นั้นออกจากกัน เพราะสเปกชีตและผลการทดสอบไม่ใช่ข้อเท็จจริงประเภทเดียวกัน
นี่คือเวอร์ชันที่ตรงไปตรงมาของการจับคู่ครั้งนี้ และมันมีประโยชน์ยิ่งกว่าเวอร์ชันที่ยกยอปอปั้นเสียอีก
แต่ละฝ่ายได้เผยแพร่อะไรจริง ๆ
บันทึกการเปลี่ยนแปลงของ Meituan มีรายการที่ระบุวันที่ — "เวอร์ชัน: 2026-09-25, LongCat-2.5-Preview พร้อมใช้งานแล้ว" — โดยระบุความสามารถที่อ้างว่ามีอยู่สามข้อ: การเข้าใจภาพ การเขียนโค้ด และความเข้ากันได้กับ "Claude Code และสภาพแวดล้อมการพัฒนาสำหรับนักพัฒนากระแสหลักอื่น ๆ" พร้อมระบุชื่อ Hermes, OpenClaw, OpenCode และ Kilo Code หน้าค่าบริการของผู้ขายระบุอัตราแบบจ่ายตามการใช้งานที่ 0.30 ดอลลาร์ต่อหนึ่งล้านโทเคนอินพุตที่ไม่ได้แคช, 0.006 ดอลลาร์ต่อหนึ่งล้านโทเคนอินพุตที่แคชไว้ และ 1.20 ดอลลาร์ต่อหนึ่งล้านโทเคนเอาต์พุต โดยบนหน้าเพจนั้นเองระบุว่าเป็นส่วนลดแบบจำกัดเวลา หน้าต่างบริบทมีขนาดหนึ่งล้านโทเคน และเอาต์พุตสูงสุดคือ 131,072 ข้อมูลว่ามีพารามิเตอร์ทั้งหมดราว 1.6 ล้านล้านตัว โดยมีประมาณ 48 พันล้านตัวที่ทำงานต่อโทเคน บนโครงหลังแบบ mixture-of-experts นั้น มาจากเมทาดาทาเว็บไซต์ของ Meituan เอง และจากรายงานข่าววงการค้าจีนเกี่ยวกับรายการนี้ — ไม่ใช่จากเอกสาร API ไม่มีรายงานทางเทคนิค ไม่มีการ์ดโมเดล และไม่มีตารางเบนช์มาร์กใด ๆ มาพร้อมกับข้อมูลชุดนี้เลย ไม่มีรีพอซิทอรี LongCat-2.5-Preview บน HuggingFace และไม่มีรีพอซิทอรีที่ใช้ชื่อดังกล่าวในองค์กร GitHub ของ Meituan เมทาดาทาแคตตาล็อกโมเดลที่จัดส่งมาพร้อมกับ OpenCode บันทึกว่า open weights เป็น false

GLM-5.2 ของ Z.ai อยู่ในตำแหน่งตรงกันข้าม มันเป็นการเปิดตัวในเดือนมิถุนายนพร้อมกับอัตราค่าบริการที่เราให้บริการในราคาตามรายการ: $1.40 ต่อล้านโทเค็นอินพุต, $0.26 ต่อล้านโทเค็นอินพุตที่แคชไว้ และ $4.40 ต่อล้านโทเค็นเอาต์พุตในแค็ตตาล็อกของเรา โดยมีหน้าต่างบริบท 1,000,000 โทเค็น และเอาต์พุตสูงสุด 128,000 โทเค็น คะแนนที่เผยแพร่มาจากสองแหล่งที่แตกต่างกัน และความแตกต่างนี้สำคัญ: ตัวเลขของ Z.ai เองสำหรับ AIME 2026, HMMT February 2026, GPQA-Diamond และชุด FrontierSWE นั้นรายงานโดยผู้ขาย; ตัวเลข Coding Index และ Intelligence Index ที่แค็ตตาล็อกของเรามีอยู่นั้นมาจาก Artificial Analysis ซึ่งดำเนินการประเมินของตนเอง
มิติเดียวที่พวกเขาเท่าเทียมกันอย่างแท้จริง
ทั้งสองโมเดลอ้างว่ามีบริบทขนาด 1,000,000 โทเค็นเท่ากัน มีเพียงหนึ่งในนั้นที่มีคะแนนเผยแพร่ซึ่งทดสอบว่าโมเดลยังสามารถใช้สิ่งที่อยู่ในนั้นได้หรือไม่ Artificial Analysis บันทึกค่า Long-Context Recall ที่ 78.33 สำหรับ GLM-5.2 LongCat-2.5-Preview ไม่มีตัวเลขเทียบเท่าจากใครก็ตาม ความไม่สมมาตรนั้นคือการเปรียบเทียบทั้งหมดในบรรทัดเดียว: หน้าต่างหนึ่งล้านโทเค็นเป็นคำกล่าวเกี่ยวกับความจุของสถาปัตยกรรม ไม่ใช่เกี่ยวกับว่าโมเดลเรียกคืนข้อมูลได้อย่างถูกต้องที่โทเค็นที่ 900,000 หรือไม่ ความจุนั้นพิมพ์ได้ถูกและตรวจสอบได้แพง ซึ่งเป็นเหตุผลที่ผู้ขายทุกรายพิมพ์มัน และแทบไม่มีใครเผยแพร่การทดสอบการเรียกคืน
ดังนั้น หากงานที่ต้องใช้บริบทความยาวคือสิ่งที่คุณกำลังเลือกระหว่างสองตัวเลือกนี้ คุณกำลังเลือกระหว่างตัวเลือกหนึ่งที่มีคะแนน recall เผยแพร่ กับอีกตัวเลือกหนึ่งที่ไม่มี — และตัวเลือกที่ไม่มีนั้นก็คือตัวเลือกที่มีโปรไฟล์เบนช์มาร์กที่ยังไม่ได้วัดเช่นกัน นั่นไม่ใช่ข้อโต้แย้งต่อต้านมัน แต่เป็นข้อโต้แย้งต่อการมองว่าทั้งสองทดแทนกันได้เพียงเพราะมีจำนวนเต็มที่ตรงกัน

ช่องว่างราคามีหน้าตาอย่างไรในงานจริง
อัตราค่าบริการไม่ได้ใกล้กันเลย และทิศทางก็ไม่ใช่ทิศทางที่ผู้คนคาดหวังจากผู้ท้าชิงโอเพนเวตส์จากจีนที่สู้กับแล็บแนวหน้าของตะวันตก LongCat-2.5-Preview ถูกกว่าประมาณ 4.7 เท่าสำหรับอินพุตที่ไม่ได้แคช และถูกกว่าประมาณ 3.7 เท่าสำหรับเอาต์พุต เมื่อเทียบกับ GLM-5.2 — อัตราส่วนนี้เป็นเลขคณิตบนการ์ดราคาที่เผยแพร่ทั้งสองใบ ไม่ใช่ผลจากการวัดจริง ในการประมวลผลเอกสารรอบหนึ่งที่ใช้ 500,000 โทเคนและเขียนกลับ 20,000 โทเคน นั่นคิดเป็นประมาณ 17 เซนต์ เทียบกับประมาณ 79 เซนต์ ทั้งสองโมเดลต้องอ่านเอกสารเดียวกัน มีเพียงตัวเดียวเท่านั้นที่มีคะแนนเผยแพร่สำหรับว่ามันจะยังจดจ่ออยู่จนถึงตอนท้ายหรือไม่
ยังมีข้อควรระวังประการที่สองที่ควรพูดถึงในคราวเดียวกันด้วย: Meituan เรียกตารางราคาของตนเองว่าเป็นส่วนลดแบบจำกัดเวลา ตัวเลข $0.30 เป็นราคาโปรโมชัน และผู้ให้บริการไม่ได้บอกว่าหลังจากนั้นจะเป็นเท่าไร โมเดลต้นทุนที่สร้างจากราคาโปรโมชันย่อมมีวันหมดอายุที่คุณอ่านไม่ออก นั่นเป็นเหตุผลที่ควรทำให้การย้ายระหว่างผู้ให้บริการมีต้นทุนต่ำ มากกว่าเป็นเหตุผลให้หลีกเลี่ยงโมเดลนี้
บน OrcaRouter เส้นทางที่เราให้บริการอยู่เบื้องหลังคีย์เดียวในราคาตามที่ผู้ให้บริการประกาศ โดยมีส่วนเพิ่มเป็นศูนย์ ดังนั้นเมื่อผู้ขายปรับราคา ค่าใช้จ่ายของคุณจะสะท้อนการเปลี่ยนแปลงในวันเดียวกัน แทนที่จะรอถึงรอบต่ออายุถัดไป และการสลับใช้งานอัตโนมัติจะย้ายคำขอที่คุณภาพลดลงไปยังผู้ให้บริการที่ทำงานปกติ โดยที่แอปพลิเคชันของคุณไม่รู้ตัว GLM-5.2 เป็นหนึ่งในเส้นทางของเราส่วน LongCat-2.5-Preview ไม่ใช่ — เราไม่ได้ให้บริการโมเดลนี้ และไม่มีสิ่งใดในที่นี้ที่ควรถูกตีความว่าเป็นการอ้างเช่นนั้น Z.ai ก็เดินหน้าไปแล้วเช่นกันนับตั้งแต่เดือนมิถุนายน: GLM-5.3 เปิดให้บริการในแค็ตตาล็อกของเราแล้ว ณ วันที่ 18 สิงหาคม 2026 ดังนั้นการเปรียบเทียบที่วางกรอบว่า "โมเดลใหม่เทียบกับโมเดลปัจจุบัน" จึงเป็นการวางกรอบให้ GLM-5.2 เป็นโมเดลที่ครองตำแหน่งปัจจุบันอยู่แล้ว มากกว่าที่จะเป็นโมเดลแนวหน้า

อะไรจะทำให้เรื่องนี้จบลง และอะไรจะไม่
• คะแนน Long-Context Recall สำหรับ LongCat-2.5-Preview จาก Meituan หรือจากผู้ประเมินอิสระ จนกว่าจะมีสิ่งนั้น หน้าต่าง 1M ของมันก็เป็นเพียงข้ออ้างที่ไม่มีผลทดสอบรองรับ และ 78.33 ของ GLM-5.2 ก็เป็นตัวเลขเดียวในการเปรียบเทียบที่พูดถึงคำถามเดียวกัน
• ตารางราคาของผู้ขายที่ไม่มีป้ายบอกเวลาจำกัด ราคาที่ลดแล้วบอกคุณว่าโมเดลมีค่าใช้จ่ายเท่าไรในช่วงโปรโมชัน ไม่ใช่ราคาที่ต้องจ่ายจริง
• ตาราง benchmark รูปแบบใดก็ได้ ไม่ใช่อันดับบนลีดเดอร์บอร์ด — แค่ผลการประเมินที่เผยแพร่ออกมา เพื่อให้การเปรียบเทียบไม่ใช่การเอาสเปกมาเทียบกับหน้าผลลัพธ์อีกต่อไป
• การยืนยันเรื่องอินพุตรูปภาพ บันทึกการเปลี่ยนแปลงนำเสนอความสามารถในการเข้าใจรูปภาพเป็นฟีเจอร์เด่นที่เพิ่มเข้ามา แต่ตัวอย่างการตอบกลับในเอกสาร "Retrieve Model" ของ Meituan เองยังแสดง input_modalities เป็น ["text"] พร้อมสตริงโมดัลลิตี text->text ตัวอย่างนั้นอาจเป็นเพียงข้อมูลที่ล้าสมัยไปแล้วก็ได้ แต่อย่างไรก็ตาม มันคือสัญญาที่ผู้จำหน่ายเผยแพร่อย่างเป็นทางการ จึงควรถือว่าอินพุตรูปภาพเป็นเพียงสิ่งที่ "อ้างว่า" รองรับ ไม่ใช่ "พร้อมใช้งาน" ในทางตรงกันข้าม GLM-5.2 เป็นข้อความเข้า–ข้อความออกในแค็ตตาล็อกของเรา โดยไม่มีโมดัลลิตีรูปภาพเลย ดังนั้นในมิตินี้ ไม่มีโมเดลใดให้คำตอบที่ยืนยันได้ และหนึ่งในนั้นให้เพียงคำกล่าวอ้างเท่านั้น
• ตัวเลขของคุณเอง ช่องว่างระหว่างสิ่งที่เผยแพร่กับสิ่งที่คุณต้องการจะถูกปิดด้วยการรันทั้งสองโมเดลบนงานของคุณ และช่วงเวลาฟรีบน LongCat-2.5-Preview ทำให้เรื่องนี้มีต้นทุนต่ำในตอนนี้ ร่องรอยการให้เหตุผลที่มาในฟิลด์reasoning_contentแบบแทรกสลับ คือรายละเอียดของฮาร์เนสที่เป็นสิ่งแรกที่ต้องตรวจ เพราะเครื่องมือที่ทิ้งมันไปอย่างเงียบ ๆ จะทำให้สูญเสียประโยชน์ส่วนใหญ่ของโมเดลไปโดยไม่แจ้งข้อผิดพลาด
แล้วการเปรียบเทียบจะอยู่ตรงไหน
หากคุณต้องตัดสินใจวันนี้ และการตัดสินใจนั้นเกี่ยวข้องกับบริบทขนาดยาว GLM-5.2 คือตัวที่คุณประเมินได้จริง: มันมีค่า recall ที่เผยแพร่แล้ว มีคะแนนเขียนโค้ดจากหน่วยงานอิสระที่ 68.8 และมี Intelligence Index ที่ 33.7 จาก Artificial Analysis พร้อมราคาที่คุณใช้ตั้งงบประมาณได้ ตัวเลขเหล่านี้อธิบายโมเดลที่ความสามารถใช้ได้ แต่ไม่ถึงระดับแนวหน้า — GLM-5.3 รุ่นสืบทอดของ Z.ai เองได้คะแนนสูงกว่านี้ — แต่มันก็อธิบายอะไรบางอย่างได้ LongCat-2.5-Preview เป็นข้อเสนอที่ถูกกว่า มีบริบทใหญ่กว่า และยังไม่มีการวัดผลใด ๆ เลย โดยคุณสมบัติที่น่าดึงดูดที่สุดของมัน นั่นคือราคา ถูกระบุไว้อย่างชัดเจนว่าเป็นเพียงชั่วคราว ท่าทีที่ถูกต้องต่อมันไม่ใช่ความสงสัยกังขา แต่คือการประเมินเป็นเวลาสองสัปดาห์โดยแนบชุดวัดคะแนนของคุณเองเข้าไปด้วย และทำก่อนที่อัตราโปรโมชันจะหมดไป
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
