
LongCat-2.5-Preview กับ Kimi K3: คำถามเรื่องการเรียกคืนข้อมูลในบริบทขนาดยาวที่ยังไม่มีใครหาคำตอบได้
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 610 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 189 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
Kimi K3 ทำคะแนนได้ 88.67 ในการวัดความจำบริบท长篇 (Long-Context Recall) ซึ่งเป็นตัวเลขที่สูงที่สุดในบรรดาโมเดลทั้งหมดในแค็ตตาล็อกของเรา สำหรับคำถามเฉพาะเจาะจงว่าโมเดลยังคงใช้ข้อมูลที่ถูกฝังอยู่ลึก ๆ ภายในอินพุตยาว ๆ หรือไม่ LongCat-2.5-Preview ไม่มีคะแนน Long-Context Recall เลยแม้แต่คะแนนเดียว — ไม่ว่าจะจาก Artificial Analysis จาก Meituan หรือจากใครก็ตาม และ LongCat-2.5-Preview คือตัวที่โฆษณาหน้าต่างหนึ่งล้านโทเคนเป็นจุดขายหลัก ความไม่ลงรอยกันนี้ โมเดลที่จุดยืนหลักคือบริบท长篇 แต่กลับไม่มีการวัดบริบท长篇ใด ๆ อยู่เลย คือเนื้อแท้ทั้งหมดของการเปรียบเทียบนี้ นอกนั้นเป็นเรื่องรอง
เป็นเรื่องที่ควรอธิบายให้ชัดเจนว่าตัวเลขที่หายไปนั้นหมายถึงอะไรและไม่หมายถึงอะไร เพราะเป็นเรื่องง่ายที่จะไถลจาก “ยังไม่ได้วัด” ไปเป็น “น่าจะแย่” และไม่มีทิศทางใดที่ได้รับการสนับสนุน
สิ่งที่โมเดลทั้งสองต่างระบุไว้อย่างเป็นทางการ
Kimi K3 ของ MoonshotAI เปิดตัวเมื่อวันที่ 15 กรกฎาคม 2026 แค็ตตาล็อกของเรามีให้บริการโดยมีหน้าต่างบริบท 1,048,576 โทเคน รองรับอินพุตข้อความและรูปภาพ และอัตราค่าบริการ $3.00 ต่อล้านโทเคนอินพุต $0.30 ต่อล้านโทเคนอินพุตที่แคชไว้ และ $15.00 ต่อล้านโทเคนเอาต์พุต โปรไฟล์อิสระจาก Artificial Analysis มีดังนี้: Coding Index 76.2 อันดับที่ 9; Intelligence Index 43.6 อันดับที่ 19; GPQA Diamond 93.5%; Humanity's Last Exam 46.9%; SciCode 59.5%; Terminal-Bench v2.1 85.0; τ²-Bench banking 46.0 และ Long-Context Recall 88.67 ซึ่งเป็นค่าที่ดีที่สุดที่เรามีให้บริการ

LongCat-2.5-Preview ของ Meituan ปรากฏบนแพลตฟอร์ม LongCat API เมื่อวันที่ 25 กันยายน 2026 รายการใน changelog ของมันระบุความสามารถที่อ้างว่ามีสามประการ ได้แก่ การทำความเข้าใจภาพ การเขียนโค้ด และความเข้ากันได้กับ "Claude Code และสภาพแวดล้อมการพัฒนาสายหลักอื่น ๆ" โดยระบุชื่อ Hermes, OpenClaw, OpenCode และ Kilo Code หน้าราคาระบุ $0.30 ต่ออินพุตที่ไม่ถูกแคช 1 ล้านโทเค็น, $0.006 ต่ออินพุตที่แคชแล้ว 1 ล้านโทเค็น และ $1.20 ต่อเอาต์พุต 1 ล้านโทเค็น โดยระบุว่าเป็นส่วนลดแบบจำกัดเวลา หน้าต่างบริบท 1,000,000; เอาต์พุตสูงสุด 131,072 ตัวเลขพารามิเตอร์รวม ~1.6T / พารามิเตอร์ที่ใช้งาน ~48B มาจากเมทาดาทาเว็บไซต์ของ Meituan และการรายงานข่าววงการจีน ไม่ได้มาจากเอกสารทางการ ไม่มีตาราง benchmark, ไม่มี model card, ไม่มีรายงานทางเทคนิค, ไม่มี repository บน HuggingFace หรือในองค์กร GitHub ของ Meituan และเมทาดาทาของแค็ตตาล็อกบันทึกว่า open weights เป็นเท็จ
ทำไมตัวเลขที่หายไปจึงสำคัญที่นี่มากกว่าแมตช์อัพอื่นๆ
การเรียกคืนบริบทขนาดยาวไม่ใช่คะแนนหนึ่งในหลายคะแนนสำหรับสองโมเดลนี้ มันเป็นคะแนนที่ทดสอบสิ่งที่ทั้งสองขาย หน้าต่างหนึ่งล้านโทเคนเป็นข้อความเกี่ยวกับความจุของสถาปัตยกรรม; การเรียกคืนวัดว่าโมเดลยังสามารถดึงและใช้ข้อเท็จจริงที่วางไว้ที่โทเคน 900,000 แทนที่จะเป็นโทเคน 900 ได้หรือไม่ ผู้ขายเผยแพร่สิ่งแรกเพราะมันเป็นข้อกำหนด ผู้ประเมินอิสระเผยแพร่สิ่งหลังเพราะมันเป็นการทดสอบ และโมเดลส่วนใหญ่ทำได้ไม่ดีเท่าที่ขนาดหน้าต่างของมันบ่งบอก
ดังนั้น จุดยืนที่ซื่อตรงจึงแคบกว่าที่ฟังดูเป็นอย่างนั้น 88.67 ของ Kimi K3 ไม่ได้หมายความว่า Kimi K3 เป็นโมเดลบริบทยาวที่ดีกว่า LongCat-2.5-Preview แต่หมายความว่า Kimi K3 เป็นตัวที่คำถามนี้ถูกถามและตอบแล้ว LongCat-2.5-Preview อาจดีกว่าก็ได้ อาจแย่กว่าอย่างมีนัยสำคัญก็ได้ ประเด็นคือ ตอนนี้ไม่มีใครนอกจาก Meituan ที่รู้ และหน้าต่าง 1M ที่พิมพ์อยู่บนหน้าข้อมูลราคาก็ไม่ใช่หลักฐานที่ชี้ไปในทางใดทางหนึ่ง

ภาพรวมต้นทุน พร้อมคำเตือนเรื่องการคำนวณแบบเดียวกัน
ตามราคาที่ประกาศไว้ LongCat-2.5-Preview ถูกกว่า Kimi K3 ถึง 10 เท่าสำหรับอินพุตที่ไม่ได้แคช และถูกกว่า 12.5 เท่าสำหรับเอาต์พุต การอ่าน 500,000 โทเคนที่เขียนกลับ 20,000 โทเคน คิดเป็นเงินราว $1.80 บน Kimi K3 และราว 17 เซนต์บน LongCat-2.5-Preview ทั้งสองเป็นการคำนวณเลขจากราคาตามบัตร ไม่ใช่จากการวัดจริง และตัวเลขของ LongCat มีข้อแม้เพิ่มเติมที่ตัวเลขของ Kimi ไม่มี: Meituan ระบุว่าอัตราของตัวเองเป็นส่วนลดแบบจำกัดเวลา ดังนั้นจึงไม่รู้ว่าตัวเลขที่จะคงเหลือหลังโปรโมชันคือเท่าใด
ลองเทียบเรื่องนั้นกับคำถามด้านความครอบคลุม หากคุณกำลังประมวลผลอินพุต 500,000 โทเค็น และยังไม่ได้วัดความสามารถในการเรียกคืนของโมเดลที่ความลึกระดับนั้น ความแตกต่างของต้นทุนก็ไม่ใช่การประหยัด — มันคือราคาของอัตราความล้มเหลวที่ไม่ทราบค่า คำขอราคา 17 เซนต์ที่พลาดส่วนที่เกี่ยวข้องไปอย่างเงียบ ๆ แพงกว่าคำขอราคา $1.80 ที่หาส่วนนั้นเจอ เพราะคุณต้องจ่ายค่ารันซ้ำและการดีบักไม่ว่าจะทางไหน นี่คือรูปแบบเฉพาะของความเสี่ยง และนั่นคือเหตุผลว่าทำไมการขาดเบนช์มาร์กจึงเป็นปัญหาด้านต้นทุน ไม่ใช่แค่ปัญหาด้านการตลาด
สิ่งที่ต้องทำในขณะที่หมายเลขยังไม่มีอยู่
สร้างของคุณเอง นี่เป็นกรณีหายากที่ช่วงเวลาฟรีเหมาะกับช่องว่างนี้อย่างแท้จริง: LongCat-2.5-Preview เรียกใช้ผ่าน OpenCode ได้โดยไม่มีค่าใช้จ่ายเป็นระยะเวลาที่ยังไม่ระบุความยาว พร้อมนโยบายไม่เก็บข้อมูล (zero-retention) ที่ OpenCode ระบุไว้ — การฝึกโมเดล "Not used" การเก็บข้อมูล "0 days" — ซึ่งหมายความว่าคุณชี้มันไปยังรีโพซิทอรีส่วนตัวได้โดยไม่ต้องคุยเรื่องการประมวลผลข้อมูลก่อน สร้างการทดสอบแบบเข็มในกองหญ้าที่ความลึกที่คุณใช้จริง รันกับทั้งสองโมเดล แล้วคุณจะได้ตัวเลขที่ไม่มีผู้จำหน่ายรายใดเผยแพร่ สองสิ่งที่ต้องตรวจสอบก่อนที่คุณจะเชื่อผลลัพธ์: ว่าฮาร์เนสของคุณเปิดเผยฟิลด์ที่สอดแทรกreasoning_content ที่โมเดลส่งคืน และว่าอินพุตรูปภาพทำงานได้จริงหรือไม่ เนื่องจาก changelog ของ Meituan อ้างว่าใช้ได้ ขณะที่ตัวอย่าง "Retrieve Model" ของมันเองยังแสดงinput_modalities เป็น ["text"] พร้อมกับ text->text สตริง.

ส่วนของ OrcaRouter ในอันนี้
เราให้บริการ Kimi K3 ที่ ราคาตามประกาศของ MoonshotAI โดย ไม่บวกเพิ่ม LongCat-2.5-Preview ไม่ใช่หนึ่งในเส้นทางของเรา เราไม่ได้ให้บริการโมเดลนี้ และไม่มีข้อความใดในบทความนี้ที่ควรอ่านได้ว่าเราให้บริการ
สำหรับการเปรียบเทียบนี้โดยเฉพาะ ส่วนที่มีประโยชน์ของเราเตอร์ไม่ใช่ราคา แต่เป็นว่าโมเดลที่คุณกำลังประเมินและโมเดลที่คุณพึ่งพาอยู่นั้นสามารถอยู่เบื้องหลังคีย์เดียวกันได้ ค่า recall 88.67 ของ Kimi K3 ทำให้มันเป็นโมเดลที่คุณจะส่งผ่านงานบริบทแบบยาวในวันนี้; LongCat-2.5-Preview คือโมเดลที่คุณต้องการทดสอบเทียบกับมัน เพราะหากค่า recall ของมันยังคงดีอยู่ที่ราคาเพียงหนึ่งในสิบสองของราคาเอาต์พุต เศรษฐศาสตร์ของงานเอกสารยาวก็จะเปลี่ยนไป การหลอมรวมโมเดลคือกลไกที่ทำให้สิ่งนั้นเป็นรูปธรรมมากกว่าเชิงทฤษฎี: การค้นคืนบริบทแบบยาวและขั้นตอนการสังเคราะห์ขั้นสุดท้ายสามารถเป็นสองโมเดลที่แตกต่างกันในคำขอเดียว ดังนั้นโมเดลราคาถูกที่ยังไม่ได้วัดและโมเดลราคาแพงที่วัดแล้วจึงไม่จำเป็นต้องเป็นอย่างใดอย่างหนึ่ง จากนั้น การสลับสำรองอัตโนมัติก็ครอบคลุมกรณีที่หนึ่งในนั้นเสื่อมประสิทธิภาพ ซึ่งสำคัญกว่าปกติเมื่อหนึ่งในสองตัวเลือกของคุณไม่มีประวัติการให้บริการที่คุณสามารถตรวจสอบได้
คำตัดสินที่กล่าวออกมาพร้อมความไม่แน่นอนของตัวมันเองที่แนบมาด้วย
ถ้าคุณต้องการให้งานที่ใช้บริบทยาวเชื่อถือได้ในสัปดาห์นี้ Kimi K3 คือตัวเลือกที่สมเหตุสมผล: ค่า recall 88.67 เป็นตัวเลขที่ดีที่สุดที่มีสำหรับความสามารถที่กำลังพิจารณาอยู่ และโปรไฟล์ที่กว้างขึ้นของมัน — Coding 76.2, Intelligence 43.6, GPQA Diamond 93.5% — นั้นมั่นคงมากกว่าจะน่าตื่นเต้น โดยทั้งหมดมาจากแหล่งข้อมูลอิสระ ถ้าคุณยินดีที่จะใช้เวลาช่วงบ่ายในการสร้างการประเมินของคุณเอง LongCat-2.5-Preview คือการเดิมพันที่น่าสนใจกว่า: หน้าต่างขนาดหนึ่งล้านโทเค็น ขีดจำกัดเอาต์พุต 131,072 โทเค็น การเข้าถึงแบบไม่เก็บข้อมูล และอัตราค่าบริการที่ต่ำกว่าของ Kimi K3 หนึ่งลำดับขนาด โดยทั้งหมดนี้ขึ้นอยู่กับคำกล่าวอ้างของผู้จำหน่ายที่ยังไม่มีใครทดสอบในที่สาธารณะ
สิ่งที่ไม่สามารถแก้ต่างได้ คือการถือว่าทั้งสองเทียบเท่ากันเพราะทั้งคู่ระบุหนึ่งล้านโทเคน อันหนึ่งมีตัวเลขผูกอยู่กับหน้าต่างนั้น ส่วนอีกอันมีราคา สิ่งเหล่านี้เป็นหลักฐานคนละแบบ และช่องว่างระหว่างสองสิ่งนั้นคือสิ่งเดียวที่การเปรียบเทียบนี้พูดถึงจริง ๆ
