
LongCat-2.5-Preview กับ Grok 4.6: ตัวหนึ่งมีการ์ด Benchmark อีกตัวหนึ่งมีรุ่นสืบทอด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 610 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 189 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
การเปรียบเทียบ LongCat-2.5-Previewกับ Grok 4.6เป็นเรื่องที่ชวนกระอักกระอ่วนด้วยเหตุผลที่ไม่เกี่ยวกับคุณภาพของโมเดลทั้งสองเลยแม้แต่น้อย นั่นคือคำถามนี้มีวันหมดอายุ Grok 4.6 เปิดตัวเมื่อวันที่ 12 สิงหาคม 2026 และ Grok 4.7 เปิดตัวเมื่อวันที่ 21 กันยายน 2026 — หกวันก่อนที่ข้อความนี้จะถูกเขียนขึ้น — ด้วยอัตราค่าใช้จ่ายเท่าเดิมคือ 2.00 ดอลลาร์ / 6.00 ดอลลาร์ต่อล้านโทเค็น และหน้าต่างบริบท 500,000 โทเค็นเท่าเดิม ขณะที่ LongCat-2.5-Preview นั้นเปิดตัวบนแพลตฟอร์ม LongCat API ของ Meituan เมื่อวันที่ 25 กันยายน 2026 โดยไม่มีผู้สืบทอดที่ประกาศออกมาให้เห็นที่ไหนเลย และไม่มีผลการวัดประสิทธิภาพที่เผยแพร่เลยแม้แต่ชิ้นเดียว ดังนั้นทางเลือกที่แท้จริงจึงไม่ใช่ "โมเดลไหนดีกว่า" แต่คือคุณต้องการความสามารถที่ผ่านการวัดผลแล้วซึ่งมีผู้สืบทอดที่ผ่านการวัดผลแล้วยืนรออยู่ข้างหลังแล้ว หรือความสามารถที่ยังไม่ได้วัดผลซึ่งอย่างน้อยก็เป็นสิ่งที่ล่าสุดในตอนนี้
การวางกรอบแบบนั้นน่าตื่นเต้นน้อยกว่าป้ายคะแนน และมีประโยชน์กว่ามาก
เริ่มจากสิ่งที่ Grok 4.6 มีอยู่ในบันทึกจริง ๆ
Grok 4.6 เป็นโมเดลที่มีเอกสารประกอบครบถ้วน ในแค็ตตาล็อกของเรา โมเดลนี้มีหน้าต่างบริบท 500,000 โทเคน รองรับอินพุตข้อความ รูปภาพ และไฟล์ และมีเรตการ์ดที่ $2.00 ต่อล้านโทเคนอินพุต, $6.00 ต่อล้านโทเคนเอาต์พุต และ $0.50 ต่อล้านโทเคนอินพุตแคช โดยเพิ่มเป็น $4.00 และ $12.00 เมื่ออินพุตเกิน 200,000 โทเคน โปรไฟล์อิสระจาก Artificial Analysis ประกอบด้วย Coding Index 76.8 — เป็นอันดับที่ห้าในบรรดาโมเดลที่ดัชนีนี้ติดตาม — Intelligence Index 44.3 อยู่อันดับที่สิบแปด, GPQA Diamond 94.9%, Humanity's Last Exam 42.9%, SciCode 56.5%, Terminal-Bench v2.1 88.4 และ τ²-Bench สำหรับงานธนาคาร 50.7 ค่า Long-Context Recall อยู่ที่ 80.3

LongCat-2.5-Preview ไม่มีสิ่งเหล่านั้นเลย รายการบันทึกการเปลี่ยนแปลงของ Meituan สำหรับวันที่ 25 กันยายน 2026 เป็นประกาศความพร้อมใช้งานที่ระบุวันที่ ซึ่งแสดงรายการความสามารถที่อ้างว่ามีสามประการ — การเข้าใจภาพ การเขียนโค้ด และความเข้ากันได้กับ "Claude Code และสภาพแวดล้อมการพัฒนากระแสหลักอื่น ๆ" รวมถึง Hermes, OpenClaw, OpenCode และ Kilo Code — และไม่มีสิ่งใดที่คล้ายกับผลลัพธ์ หน้าตั้งราคาของผู้ขายระบุ $0.30 ต่อล้านโทเค็นอินพุตที่ไม่แคช $0.006 ต่อล้านโทเค็นอินพุตที่แคช และ $1.20 ต่อล้านโทเค็นเอาต์พุต โดยระบุชัดเจนว่าเป็นส่วนลดจำกัดเวลา หน้าต่างบริบทคือ 1,000,000 โทเค็น เอาต์พุตสูงสุดคือ 131,072 จำนวนพารามิเตอร์ทั้งหมดประมาณ 1.6 ล้านล้าน / 48 พันล้านที่ใช้งาน มาจากเมทาดาทาเว็บไซต์ของ Meituan และการรายงานข่าวในแวดวงอุตสาหกรรมของจีน มากกว่าที่จะมาจากเอกสารประกอบ ไม่มีรีโพซิทอรีสำหรับมันบน HuggingFace หรือในองค์กร GitHub ของ Meituan และเมทาดาทาแค็ตตาล็อกที่ OpenCode จัดส่งบันทึกว่า open weights เป็นเท็จ
มิติที่สกอร์บอร์ดจะมองข้ามไปโดยสิ้นเชิง
สองโมเดลนี้แตกต่างกันในสิ่งหนึ่งที่ไม่มี benchmark ใดวัดได้ และสำหรับหลายทีมแล้ว สิ่งนี้ตัดสินคำถามนั้นได้ด้วยตัวมันเอง นั่นคือ เกิดอะไรขึ้นกับพรอมป์ที่คุณส่งไป
เอกสารของ OpenCode เองระบุว่า LongCat 2.5 Preview Free ให้บริการโดยผู้ให้บริการรายหนึ่งซึ่งปฏิบัติตามนโยบายไม่เก็บข้อมูลโดยสิ้นเชิง และไม่นำข้อมูลของคุณไปใช้สำหรับการฝึกโมเดล ตารางความเป็นส่วนตัวของ Zen ก็ระบุตัวเลขไว้ชัดเจน — การฝึกโมเดล "ไม่ถูกนำไปใช้" การเก็บรักษาข้อมูล "0 วัน" ตารางความเป็นส่วนตัวเดียวกันนี้ระบุระยะเวลาการเก็บรักษา 30 วันสำหรับ Grok 4.6 และ Grok 4.7 ข้อความทั้งสองนี้เป็นของ OpenCode เผยแพร่บนหน้าของ OpenCode และอธิบายถึงรายการแบบฟรีและรายการเปรียบเทียบโดยเฉพาะ แต่ถ้าคุณกำลังชี้ให้เอเจนต์ไปที่รีโพซิทอรีส่วนตัว นั่นคือความแตกต่างระหว่างการหารือกับฝ่ายกฎหมายที่คุณไม่จำเป็นต้องมี กับการหารือที่คุณต้องมี — และมันไม่เกี่ยวเลยว่าโมเดลใดทำคะแนนได้ดีกว่าบน SciCode

สิ่งที่ "measured" ให้และไม่ให้กับคุณ
ตัวเลขของ Grok 4.6 ดีกว่าของ LongCat-2.5-Preview ในแง่เดียวที่สำคัญตรงนี้ นั่นคือมันมีอยู่จริง นั่นไม่ได้หมายความว่า Grok 4.6 เป็นโมเดลที่ดีกว่า ดัชนี Coding ของมันที่ 76.8 ต่ำกว่ารุ่น Grok 4.7 และโมเดลที่มันถูกนำไปวัดเปรียบเทียบด้วยนั้นไม่ใช่แนวหน้าของตระกูลตัวเองอีกต่อไป ผู้สืบทอดที่เผยแพร่แล้วของมันมีดัชนี Intelligence 46.4 เทียบกับ 44.3 ของ Grok 4.6 และค่า Long-Context Recall 76.67 เทียบกับ 80.33 ของ Grok 4.6 ดังนั้นผู้สืบทอดจึงไม่ได้ดีกว่าในทุกแกน ซึ่งเป็นรายละเอียดแบบที่หมายเลขรุ่นบดบังไว้พอดี
ยังมีข้อควรระวังเรื่องการให้บริการจริงที่ควรพูดให้ตรง ๆ เพราะมันตัดทอนการตีความในแง่ดีสำหรับทั้งสองโมเดล ในตัวอย่าง playground เจ็ดวันของเราเอง Grok 4.6 ไม่มีการบันทึกปริมาณงานที่วัดได้และไม่มีทราฟฟิกโทเคน ซึ่งในคอลัมน์นั้นคือหน้าตาของการไม่มีข้อมูล มากกว่าจะเป็นคำตัดสินเรื่องประสิทธิภาพ LongCat-2.5-Preview ไม่มีตัวอย่างการให้บริการของเราเลย เพราะเราไม่ได้ route ทราฟฟิกไปที่มัน ดังนั้นการเปรียบเทียบความหน่วงระหว่างสองตัวนี้จึงเป็นฝ่ายเดียวในแบบที่งานเขียนมักกลบเกลื่อนไว้ คุณไม่สามารถ benchmark โมเดลที่คุณไม่ได้ส่งทราฟฟิกไปให้ได้
ตรงที่เลเยอร์การกำหนดเส้นทางช่วยได้จริง ๆ ในกรณีนี้
สามในข้อเท็จจริงข้างต้นเป็นประเภทที่เราเตอร์ถูกสร้างขึ้นมาเพื่อรองรับโดยเฉพาะ มากกว่าเพียงแค่เข้ากันได้เท่านั้น อัตราค่าบริการของ Grok 4.6 จะเพิ่มขึ้นเมื่อเกิน 200,000 โทเค็นอินพุต ดังนั้นงานเชิงตรรกะเดียวกันอาจถูกเรียกเก็บเงินในอัตราที่ต่างกันสองอัตรา ขึ้นอยู่กับตัวเลขที่แอปพลิเคชันของคุณรู้อยู่แล้วก่อนที่จะส่งข้อมูลใด ๆ Grok 4.6 มีรุ่นสืบทอดที่ประกาศออกมาแล้วในอัตราเดียวกัน ซึ่งหมายความว่าการสลับจากรุ่นหนึ่งไปยังอีกรุ่นหนึ่งควรเป็นการเปลี่ยนแปลงเพียงบรรทัดเดียว และไม่ควรต้องบูรณาการใหม่เลย และคุณสมบัติที่น่าดึงดูดที่สุดของ LongCat-2.5-Preview — นั่นคือราคาของมัน — ถูกระบุอย่างชัดเจนโดยผู้ขายว่าเป็นเพียงชั่วคราว
บน OrcaRouter เราให้บริการ Grok 4.6 ที่ ราคาตามที่ xAI ประกาศ โดยไม่บวกเพิ่มเลยดังนั้นเมื่อผู้ให้บริการปรับอัตรา บิลของคุณจะสะท้อนการเปลี่ยนแปลงภายในวันเดียวกัน ไม่ใช่รอถึงรอบต่ออายุถัดไป และการสลับไปใช้ระบบสำรองอัตโนมัติ จะย้ายคำขอที่ทำงานผิดปกติไปยังผู้ให้บริการที่ทำงานปกติ โดยที่โค้ดของคุณไม่ต้องรู้ว่าตัวใดเป็นผู้ตอบ DSL สำหรับการกำหนดเส้นทางครอบคลุม กรณีราคาแบบขั้นบันไดได้โดยตรง และการผสานโมเดลครอบคลุมกรณีที่โมเดลที่คุณต้องการสำหรับการอ่านฉบับยาว ไม่ใช่โมเดลที่คุณต้องการสำหรับการสังเคราะห์ขั้นสุดท้าย LongCat-2.5-Preview ไม่ใช่หนึ่งในเส้นทางของเรา เราไม่ได้ให้บริการโมเดลนี้ และไม่มีสิ่งใดในที่นี้ที่อ้างเป็นอย่างอื่น ประเด็นของการเอ่ยชื่อมันไม่ใช่เพื่อให้คุณไปใช้บริการที่อื่น แต่คือโมเดลที่คุณกำลังประเมินมากกว่าที่จะรัน ควรอยู่หลังคีย์เดียวกับโมเดลที่คุณรัน เพื่อให้การประเมินมันมีต้นทุนเพียงรายการตั้งค่าแทนที่จะเป็นทั้งโปรเจกต์

วิธีตัดสินใจ
• เลือก Grok 4.6 หากคุณต้องการคำตอบที่คุณสามารถปกป้องได้ มันมีการ์ดอิสระ มีโปรไฟล์อินพุตที่จัดทำเป็นเอกสารไว้ และมีราคาที่ไม่หมดอายุ ความเสี่ยงหลักของมันไม่ใช่คุณภาพ แต่คือความเกี่ยวข้อง: Grok 4.7 มีอยู่ในราคาเดียวกัน และต้นทุนของการคงอยู่กับ 4.6 เพราะความเฉื่อย คือส่วนต่างระหว่างดัชนี Intelligence Index ที่ 44.3 กับ 46.4 ที่คุณไม่จำเป็นต้องจ่าย
• เลือก LongCat-2.5-Preview หากปัจจัยชี้ขาดคือการเก็บรักษาข้อมูลหรือการเข้าถึง การเข้าถึงแบบไม่เก็บข้อมูลใด ๆ ผ่าน OpenCode, หน้าต่างบริบทหนึ่งล้านโทเคน, เพดานเอาต์พุต 131,072 โทเคน และอัตราค่าบริการที่คิดเป็นประมาณหนึ่งในเจ็ดของ Grok 4.6 ล้วนเป็นข้อได้เปรียบที่แท้จริง — ข้อแรกได้รับการยืนยันจากนโยบายความเป็นส่วนตัวของบุคคลที่สาม ส่วนข้อที่เหลือมีเพียงผู้ขายเท่านั้นที่ยืนยัน
• อย่าเลือกระหว่างสองตัวนี้โดยอาศัยตาราง benchmark เพราะมีเพียงตารางเดียวเท่านั้น คะแนนเขียนโค้ด 76.8 ของ Grok 4.6 และความสามารถในการจดจำบริบทแบบยาว 80.3 อธิบายถึง Grok 4.6 ยังไม่มีสิ่งใดอธิบาย LongCat-2.5-Preview ใครก็ตามที่พิมพ์คะแนน LongCat-2.5-Preview ไว้ข้างคะแนน Grok 4.6 ในสัปดาห์นี้ ไม่ได้อ้างอิงโมเดล LongCat อื่น ก็กำลังกุตัวเลขขึ้นมา
• ตรวจสอบฝั่งอินพุตก่อนที่คุณจะสร้างต่อยอดจากมัน บันทึกการเปลี่ยนแปลงของ Meituan ขึ้นต้นด้วยการทำความเข้าใจภาพ แต่ตัวอย่างการตอบกลับในเอกสาร "Retrieve Model" ของตัวเองยังคงแสดงinput_modalities เป็น ["text"] โดยมีสตริงโมดัลลิตี text->text — เป็นคำกล่าวอ้างของผู้ขายที่ขัดกับสัญญาที่เผยแพร่ซึ่งระบุไว้เป็นอย่างอื่น Grok 4.6 รับข้อความ รูปภาพ และไฟล์โดยไม่มีความกำกวมเช่นนั้น และตรวจสอบว่าฮาร์เนสของคุณแสดงฟิลด์reasoning_contentแบบสลับกันก่อนที่คุณจะสรุปสิ่งใดเกี่ยวกับคุณภาพการให้เหตุผลของ LongCat-2.5-Preview ไคลเอนต์ที่ทิ้งฟิลด์นั้นจะล้มเหลวอย่างเงียบ ๆ
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
