การ์ดชื่อเรื่องหลักที่สร้างขึ้นซึ่งเขียนว่า 'LongCat-2.5-Preview vs Kimi K3' พร้อมข้อความเหนือหัวเรื่องว่า 'คำถามเรื่องการเรียกคืนบริบทยาว' และสองพาเนล: 'LongCat-2.5-Preview: บริบท 1M, คะแนนการเรียกคืนไม่ได้เผยแพร่' และ 'Kimi K3: AA Long-Context Recall 88.67 ซึ่งสูงที่สุดที่เรามี' โลโก้ OrcaRouter มุมขวาล่าง
Engineering & Research

LongCat-2.5-Preview กับ Kimi K3: คำถามเรื่องการเรียกคืนข้อมูลในบริบทขนาดยาวที่ยังไม่มีใครหาคำตอบได้

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Kimi K3 ทำคะแนนได้ 88.67 ในการวัดความจำบริบท长篇 (Long-Context Recall) ซึ่งเป็นตัวเลขที่สูงที่สุดในบรรดาโมเดลทั้งหมดในแค็ตตาล็อกของเรา สำหรับคำถามเฉพาะเจาะจงว่าโมเดลยังคงใช้ข้อมูลที่ถูกฝังอยู่ลึก ๆ ภายในอินพุตยาว ๆ หรือไม่ LongCat-2.5-Preview ไม่มีคะแนน Long-Context Recall เลยแม้แต่คะแนนเดียว — ไม่ว่าจะจาก Artificial Analysis จาก Meituan หรือจากใครก็ตาม และ LongCat-2.5-Preview คือตัวที่โฆษณาหน้าต่างหนึ่งล้านโทเคนเป็นจุดขายหลัก ความไม่ลงรอยกันนี้ โมเดลที่จุดยืนหลักคือบริบท长篇 แต่กลับไม่มีการวัดบริบท长篇ใด ๆ อยู่เลย คือเนื้อแท้ทั้งหมดของการเปรียบเทียบนี้ นอกนั้นเป็นเรื่องรอง

เป็นเรื่องที่ควรอธิบายให้ชัดเจนว่าตัวเลขที่หายไปนั้นหมายถึงอะไรและไม่หมายถึงอะไร เพราะเป็นเรื่องง่ายที่จะไถลจาก “ยังไม่ได้วัด” ไปเป็น “น่าจะแย่” และไม่มีทิศทางใดที่ได้รับการสนับสนุน

สิ่งที่โมเดลทั้งสองต่างระบุไว้อย่างเป็นทางการ

Kimi K3 ของ MoonshotAI เปิดตัวเมื่อวันที่ 15 กรกฎาคม 2026 แค็ตตาล็อกของเรามีให้บริการโดยมีหน้าต่างบริบท 1,048,576 โทเคน รองรับอินพุตข้อความและรูปภาพ และอัตราค่าบริการ $3.00 ต่อล้านโทเคนอินพุต $0.30 ต่อล้านโทเคนอินพุตที่แคชไว้ และ $15.00 ต่อล้านโทเคนเอาต์พุต โปรไฟล์อิสระจาก Artificial Analysis มีดังนี้: Coding Index 76.2 อันดับที่ 9; Intelligence Index 43.6 อันดับที่ 19; GPQA Diamond 93.5%; Humanity's Last Exam 46.9%; SciCode 59.5%; Terminal-Bench v2.1 85.0; τ²-Bench banking 46.0 และ Long-Context Recall 88.67 ซึ่งเป็นค่าที่ดีที่สุดที่เรามีให้บริการ

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

LongCat-2.5-Preview ของ Meituan ปรากฏบนแพลตฟอร์ม LongCat API เมื่อวันที่ 25 กันยายน 2026 รายการใน changelog ของมันระบุความสามารถที่อ้างว่ามีสามประการ ได้แก่ การทำความเข้าใจภาพ การเขียนโค้ด และความเข้ากันได้กับ "Claude Code และสภาพแวดล้อมการพัฒนาสายหลักอื่น ๆ" โดยระบุชื่อ Hermes, OpenClaw, OpenCode และ Kilo Code หน้าราคาระบุ $0.30 ต่ออินพุตที่ไม่ถูกแคช 1 ล้านโทเค็น, $0.006 ต่ออินพุตที่แคชแล้ว 1 ล้านโทเค็น และ $1.20 ต่อเอาต์พุต 1 ล้านโทเค็น โดยระบุว่าเป็นส่วนลดแบบจำกัดเวลา หน้าต่างบริบท 1,000,000; เอาต์พุตสูงสุด 131,072 ตัวเลขพารามิเตอร์รวม ~1.6T / พารามิเตอร์ที่ใช้งาน ~48B มาจากเมทาดาทาเว็บไซต์ของ Meituan และการรายงานข่าววงการจีน ไม่ได้มาจากเอกสารทางการ ไม่มีตาราง benchmark, ไม่มี model card, ไม่มีรายงานทางเทคนิค, ไม่มี repository บน HuggingFace หรือในองค์กร GitHub ของ Meituan และเมทาดาทาของแค็ตตาล็อกบันทึกว่า open weights เป็นเท็จ

ทำไมตัวเลขที่หายไปจึงสำคัญที่นี่มากกว่าแมตช์อัพอื่นๆ

การเรียกคืนบริบทขนาดยาวไม่ใช่คะแนนหนึ่งในหลายคะแนนสำหรับสองโมเดลนี้ มันเป็นคะแนนที่ทดสอบสิ่งที่ทั้งสองขาย หน้าต่างหนึ่งล้านโทเคนเป็นข้อความเกี่ยวกับความจุของสถาปัตยกรรม; การเรียกคืนวัดว่าโมเดลยังสามารถดึงและใช้ข้อเท็จจริงที่วางไว้ที่โทเคน 900,000 แทนที่จะเป็นโทเคน 900 ได้หรือไม่ ผู้ขายเผยแพร่สิ่งแรกเพราะมันเป็นข้อกำหนด ผู้ประเมินอิสระเผยแพร่สิ่งหลังเพราะมันเป็นการทดสอบ และโมเดลส่วนใหญ่ทำได้ไม่ดีเท่าที่ขนาดหน้าต่างของมันบ่งบอก

ดังนั้น จุดยืนที่ซื่อตรงจึงแคบกว่าที่ฟังดูเป็นอย่างนั้น 88.67 ของ Kimi K3 ไม่ได้หมายความว่า Kimi K3 เป็นโมเดลบริบทยาวที่ดีกว่า LongCat-2.5-Preview แต่หมายความว่า Kimi K3 เป็นตัวที่คำถามนี้ถูกถามและตอบแล้ว LongCat-2.5-Preview อาจดีกว่าก็ได้ อาจแย่กว่าอย่างมีนัยสำคัญก็ได้ ประเด็นคือ ตอนนี้ไม่มีใครนอกจาก Meituan ที่รู้ และหน้าต่าง 1M ที่พิมพ์อยู่บนหน้าข้อมูลราคาก็ไม่ใช่หลักฐานที่ชี้ไปในทางใดทางหนึ่ง

A screenshot of OrcaRouter's own model page for MoonshotAI Kimi K3 at /models/kimi/kimi-k3, showing the kimi/kimi-k3 identifier, a 1M-token context window, text + image input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-07-15, a p50 first-token figure of 8.24 s, $3.00 and $15.00 rate tiles, and the OpenAI-compatible code samples.

ภาพรวมต้นทุน พร้อมคำเตือนเรื่องการคำนวณแบบเดียวกัน

ตามราคาที่ประกาศไว้ LongCat-2.5-Preview ถูกกว่า Kimi K3 ถึง 10 เท่าสำหรับอินพุตที่ไม่ได้แคช และถูกกว่า 12.5 เท่าสำหรับเอาต์พุต การอ่าน 500,000 โทเคนที่เขียนกลับ 20,000 โทเคน คิดเป็นเงินราว $1.80 บน Kimi K3 และราว 17 เซนต์บน LongCat-2.5-Preview ทั้งสองเป็นการคำนวณเลขจากราคาตามบัตร ไม่ใช่จากการวัดจริง และตัวเลขของ LongCat มีข้อแม้เพิ่มเติมที่ตัวเลขของ Kimi ไม่มี: Meituan ระบุว่าอัตราของตัวเองเป็นส่วนลดแบบจำกัดเวลา ดังนั้นจึงไม่รู้ว่าตัวเลขที่จะคงเหลือหลังโปรโมชันคือเท่าใด

ลองเทียบเรื่องนั้นกับคำถามด้านความครอบคลุม หากคุณกำลังประมวลผลอินพุต 500,000 โทเค็น และยังไม่ได้วัดความสามารถในการเรียกคืนของโมเดลที่ความลึกระดับนั้น ความแตกต่างของต้นทุนก็ไม่ใช่การประหยัด — มันคือราคาของอัตราความล้มเหลวที่ไม่ทราบค่า คำขอราคา 17 เซนต์ที่พลาดส่วนที่เกี่ยวข้องไปอย่างเงียบ ๆ แพงกว่าคำขอราคา $1.80 ที่หาส่วนนั้นเจอ เพราะคุณต้องจ่ายค่ารันซ้ำและการดีบักไม่ว่าจะทางไหน นี่คือรูปแบบเฉพาะของความเสี่ยง และนั่นคือเหตุผลว่าทำไมการขาดเบนช์มาร์กจึงเป็นปัญหาด้านต้นทุน ไม่ใช่แค่ปัญหาด้านการตลาด

สิ่งที่ต้องทำในขณะที่หมายเลขยังไม่มีอยู่

สร้างของคุณเอง นี่เป็นกรณีหายากที่ช่วงเวลาฟรีเหมาะกับช่องว่างนี้อย่างแท้จริง: LongCat-2.5-Preview เรียกใช้ผ่าน OpenCode ได้โดยไม่มีค่าใช้จ่ายเป็นระยะเวลาที่ยังไม่ระบุความยาว พร้อมนโยบายไม่เก็บข้อมูล (zero-retention) ที่ OpenCode ระบุไว้ — การฝึกโมเดล "Not used" การเก็บข้อมูล "0 days" — ซึ่งหมายความว่าคุณชี้มันไปยังรีโพซิทอรีส่วนตัวได้โดยไม่ต้องคุยเรื่องการประมวลผลข้อมูลก่อน สร้างการทดสอบแบบเข็มในกองหญ้าที่ความลึกที่คุณใช้จริง รันกับทั้งสองโมเดล แล้วคุณจะได้ตัวเลขที่ไม่มีผู้จำหน่ายรายใดเผยแพร่ สองสิ่งที่ต้องตรวจสอบก่อนที่คุณจะเชื่อผลลัพธ์: ว่าฮาร์เนสของคุณเปิดเผยฟิลด์ที่สอดแทรกreasoning_content ที่โมเดลส่งคืน และว่าอินพุตรูปภาพทำงานได้จริงหรือไม่ เนื่องจาก changelog ของ Meituan อ้างว่าใช้ได้ ขณะที่ตัวอย่าง "Retrieve Model" ของมันเองยังแสดงinput_modalities เป็น ["text"] พร้อมกับ text->text สตริง.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs Kimi K3' with the subhead 'The one model advertising a long window is the one with no recall score'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, long-context recall not published by anyone, coding index not published, no repo and catalogue open_weights false. Right column 'Kimi K3' (MoonshotAI, released 2026-07-15, independently scored): 1,048,576-token context, max output not published, text and image to text, $3.00 uncached / $0.30 cached input, $15.00 output, long-context recall 88.67 described as the highest we carry, coding index 76.2 at rank 9 and intelligence index 43.6 at rank 19 by Artificial Analysis. The footnote adds that a 500,000-token read writing 20,000 tokens back is roughly $1.80 on Kimi K3 against roughly 17 cents on LongCat-2.5-Preview at its published promotional rate. Footnote credits the left column to Meituan's changelog and pricing page and the right column to OrcaRouter's catalogue with index figures sourced to Artificial Analysis, and notes that LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

ส่วนของ OrcaRouter ในอันนี้

เราให้บริการ Kimi K3 ที่ ราคาตามประกาศของ MoonshotAI โดย ไม่บวกเพิ่ม LongCat-2.5-Preview ไม่ใช่หนึ่งในเส้นทางของเรา เราไม่ได้ให้บริการโมเดลนี้ และไม่มีข้อความใดในบทความนี้ที่ควรอ่านได้ว่าเราให้บริการ

สำหรับการเปรียบเทียบนี้โดยเฉพาะ ส่วนที่มีประโยชน์ของเราเตอร์ไม่ใช่ราคา แต่เป็นว่าโมเดลที่คุณกำลังประเมินและโมเดลที่คุณพึ่งพาอยู่นั้นสามารถอยู่เบื้องหลังคีย์เดียวกันได้ ค่า recall 88.67 ของ Kimi K3 ทำให้มันเป็นโมเดลที่คุณจะส่งผ่านงานบริบทแบบยาวในวันนี้; LongCat-2.5-Preview คือโมเดลที่คุณต้องการทดสอบเทียบกับมัน เพราะหากค่า recall ของมันยังคงดีอยู่ที่ราคาเพียงหนึ่งในสิบสองของราคาเอาต์พุต เศรษฐศาสตร์ของงานเอกสารยาวก็จะเปลี่ยนไป การหลอมรวมโมเดลคือกลไกที่ทำให้สิ่งนั้นเป็นรูปธรรมมากกว่าเชิงทฤษฎี: การค้นคืนบริบทแบบยาวและขั้นตอนการสังเคราะห์ขั้นสุดท้ายสามารถเป็นสองโมเดลที่แตกต่างกันในคำขอเดียว ดังนั้นโมเดลราคาถูกที่ยังไม่ได้วัดและโมเดลราคาแพงที่วัดแล้วจึงไม่จำเป็นต้องเป็นอย่างใดอย่างหนึ่ง จากนั้น การสลับสำรองอัตโนมัติก็ครอบคลุมกรณีที่หนึ่งในนั้นเสื่อมประสิทธิภาพ ซึ่งสำคัญกว่าปกติเมื่อหนึ่งในสองตัวเลือกของคุณไม่มีประวัติการให้บริการที่คุณสามารถตรวจสอบได้

คำตัดสินที่กล่าวออกมาพร้อมความไม่แน่นอนของตัวมันเองที่แนบมาด้วย

ถ้าคุณต้องการให้งานที่ใช้บริบทยาวเชื่อถือได้ในสัปดาห์นี้ Kimi K3 คือตัวเลือกที่สมเหตุสมผล: ค่า recall 88.67 เป็นตัวเลขที่ดีที่สุดที่มีสำหรับความสามารถที่กำลังพิจารณาอยู่ และโปรไฟล์ที่กว้างขึ้นของมัน — Coding 76.2, Intelligence 43.6, GPQA Diamond 93.5% — นั้นมั่นคงมากกว่าจะน่าตื่นเต้น โดยทั้งหมดมาจากแหล่งข้อมูลอิสระ ถ้าคุณยินดีที่จะใช้เวลาช่วงบ่ายในการสร้างการประเมินของคุณเอง LongCat-2.5-Preview คือการเดิมพันที่น่าสนใจกว่า: หน้าต่างขนาดหนึ่งล้านโทเค็น ขีดจำกัดเอาต์พุต 131,072 โทเค็น การเข้าถึงแบบไม่เก็บข้อมูล และอัตราค่าบริการที่ต่ำกว่าของ Kimi K3 หนึ่งลำดับขนาด โดยทั้งหมดนี้ขึ้นอยู่กับคำกล่าวอ้างของผู้จำหน่ายที่ยังไม่มีใครทดสอบในที่สาธารณะ

สิ่งที่ไม่สามารถแก้ต่างได้ คือการถือว่าทั้งสองเทียบเท่ากันเพราะทั้งคู่ระบุหนึ่งล้านโทเคน อันหนึ่งมีตัวเลขผูกอยู่กับหน้าต่างนั้น ส่วนอีกอันมีราคา สิ่งเหล่านี้เป็นหลักฐานคนละแบบ และช่องว่างระหว่างสองสิ่งนั้นคือสิ่งเดียวที่การเปรียบเทียบนี้พูดถึงจริง ๆ

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube