
LongCat-2.5-Preview vs Qwen3.8-Max: ราคาเพียงหนึ่งในเจ็ด และไม่ปรากฏบนกระดานคะแนนเลย
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 610 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 189 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
Meituan นำ LongCat-2.5-Previewขึ้นแพลตฟอร์ม API ของตนเมื่อวันที่ 25 กันยายน 2026 พร้อมรายการบันทึกการเปลี่ยนแปลง ตารางราคา และไม่มีการเปรียบเทียบประสิทธิภาพใด ๆ เลย จากนั้นตั้งราคาไว้ที่ประมาณหนึ่งในเจ็ดของสิ่งที่ Qwen3.8-Maxเรียกเก็บสำหรับการเรียกใช้งานแบบเดียวกัน นั่นไม่ใช่ช่องว่างเล็ก ๆ และไม่ใช่ช่องว่างที่ปลอดภัย Qwen3.8-Max ซึ่งเป็นเรือธงของผู้ให้บริการรายนี้ เปิดให้ใช้ทั่วไปมาตั้งแต่ 3 สิงหาคม 2026 มีอันดับจาก Artificial Analysis ที่เป็นอิสระ เผยแพร่สแนปช็อตที่ระบุวันที่ซึ่งคุณปักหมุดตามชื่อได้ และคิดค่าบริการแพงกว่า 6.7 เท่าสำหรับอินพุต และ 5 เท่าสำหรับเอาต์พุต คำถามที่การเปรียบเทียบนี้ต้องตอบไม่ใช่ว่ารุ่นใดดีกว่า — ยังไม่มีใครนอกจาก Meituan ที่อยู่ในสถานะจะตอบได้ — แต่คือสิ่งที่คุณกำลังซื้อด้วยส่วนต่างนั้น และว่าส่วนต่างนั้นคุ้มค่าที่จะซื้อหรือไม่
แต่ละฝ่ายได้เผยแพร่อะไรจริง ๆ
เริ่มจากแหล่งที่มา เพราะนั่นคือสิ่งที่แยกสองสิ่งนี้ออกจากกันได้คมชัดยิ่งกว่าที่เกณฑ์วัดใด ๆ จะทำได้
LongCat-2.5-Preview เปิดตัวพร้อมกับรายการที่ลงวันที่ในบันทึกการเปลี่ยนแปลงของ Meituan เอง — คำกล่าวของผู้ขาย: "เวอร์ชัน: 2026-09-25 — LongCat-2.5-Preview พร้อมใช้งานแล้ว" — หน้าเพจราคาที่ระบุว่าเป็นโมเดลแบบจ่ายตามการใช้งานจริง (pay-as-you-go) ปัจจุบันของแพลตฟอร์ม และคู่มือเริ่มต้นอย่างรวดเร็วที่ครอบคลุมทั้งสองรูปแบบการเชื่อมต่อ บัญชี X ของ Meituan เองอธิบายว่าเป็น "พารามิเตอร์ 1.6T ~48B ที่ใช้งานอยู่ หน้าต่างบริบท 1M โทเคน มัลติโหมดโดยกำเนิด" นอกเหนือจากนั้น ไม่มีอะไรให้อ่าน ไม่มีรีโพซิทอรีในองค์กร Hugging Face ของmeituan-longcat ที่ครอบคลุมโมเดลนี้ — รีโพซิทอรีล่าสุดขององค์กรคือ LongCat-Flash-Lite-Sparse จากวันที่ 31 กรกฎาคม — และแค็ตตาล็อกโมเดล OpenCode ซึ่งให้บริการโมเดลนี้ บันทึกว่าเป็นแบบ closed-weight ไม่มีการ์ดโมเดล ไม่มีรายงานทางเทคนิค ไม่มีสัญญาอนุญาต ไม่มีตารางพารามิเตอร์ที่เผยแพร่โดยผู้ขาย และไม่มีการประเมินอิสระที่ใดเลย ณ วันที่ 27 กันยายน ไม่มีหน้า LongCat-2.5-Preview บน Artificial Analysis
Qwen3.8-Max เป็นกรณีตรงกันข้ามในแทบทุกแง่มุม เปิดให้ใช้งานทั่วไปเมื่อวันที่ 3 สิงหาคม 2026 พร้อมตารางราคาที่เปิดเผย และ Alibaba ได้เปิดตัวเวอร์ชันปรับปรุงที่มีชื่อเฉพาะว่า Qwen3.8-Max-0902 เมื่อวันที่ 2 กันยายน Artificial Analysis วัดผลได้ดังนี้ ดัชนี Intelligence Index 45.4 อยู่อันดับ 15 จาก 145 โมเดล และ Coding Index 76.2 อยู่อันดับ 9 จาก 138 โดยทำคะแนน GPQA Diamond 92.8% Humanity's Last Exam 43.1% SciCode 52.1% Long-Context Recall 80.3% Terminal-Bench 2.1 ที่ 88.8% และ τ-bench ด้านธนาคารที่ 47.8% นั่นคือโมเดลที่ผ่านการวัดผลจริง โดยมีหลักฐานยืนยันสำหรับทุกตัวเลข
ดังนั้น สรุปอย่างตรงไปตรงมาของคอลัมน์หลักฐานจึงเอนเอียงไปข้างหนึ่งในลักษณะที่ไม่เกี่ยวกับความสามารถเลย หนึ่งในโมเดลเหล่านี้สามารถประเมินได้ก่อนที่คุณจะตัดสินใจ ส่วนอีกโมเดลหนึ่งทำได้เพียงลองใช้เท่านั้น
เรตการ์ด ทีละบรรทัด
ทั้งคู่เป็นโมเดลล้านโทเคนที่มีเพดานเอาต์พุตเท่ากัน ดังนั้นสเปกชีตจึงบรรจบกันตรงจุดที่สเปกชีตมีประโยชน์น้อยที่สุดพอดี:
• อินพุตแบบไม่แคช — LongCat-2.5-Preview $0.30 ต่อ 1M เทียบกับ Qwen3.8-Max $2.00 ต่อ 1M ต่างกัน 6.7 เท่า
• อินพุตแคช — $0.006 ต่อ 1M เทียบกับ $0.25 ต่อ 1M ต่างกันถึง 41.7 เท่า
• เอาต์พุต — $1.20 ต่อ 1M เทียบกับ $6.00 ต่อ 1M ห่างกัน 5 เท่า
• หน้าต่างบริบท — 1,048,576 โทเค็น เทียบกับ 1,000,000 โทเค็น ในทางปฏิบัติถือว่าเสมอกัน
• เอาต์พุตสูงสุด — 131,072 โทเคนบนทั้งสอง เหมือนกันทุกประการ
• คะแนนอิสระ — ไม่มีการเผยแพร่ เทียบกับ AA Intelligence 45.4 และ AA Coding 76.2
ตัวเลข LongCat ทุกตัวที่นั่นมาจากหน้าค่าราคาของ Meituan เอง และหน้านั้นกำกับทั้งคอลัมน์ว่า "ราคาส่วนลด (ระยะเวลาจำกัด)" ส่วนตัวเลขของ Qwen3.8-Max เป็นอัตราราคาตามประกาศ (list rate) ของ Alibaba ซึ่งอ่านมาจาก model card ของเราเอง โดยมีค่า cache read อยู่ที่ $0.25 และค่า cache write อยู่ที่ $2.50 ต่อหนึ่งล้าน而对于สแนปช็อตของ Artificial Analysis นั้นลงวันที่ 2 กันยายน 2026
บรรทัดอินพุตที่แคชไว้คือสิ่งที่ต้องจ้องมอง ความแตกต่าง 42 เท่าในการอ่านแคชเป็นตัวเลขเดี่ยวที่ใหญ่ที่สุดในการเปรียบเทียบนี้ และมันตกอยู่บนมิติที่เวิร์กโหลดของเอเจนต์อาศัยอยู่จริง ๆ ลูปเอเจนต์ที่ส่งพรอมต์ระบบและสคีมาเครื่องมือขนาด 100,000 โทเค็นซ้ำในทุกเทิร์นกำลังจ่ายในอัตราแคชสำหรับโทเค็นส่วนใหญ่ของมัน ไม่ใช่อัตราอินพุตหลัก
การเรียกใช้ 150,000 โทเค็น ที่คิดราคาทั้งสองแบบ
ลองพิจารณาคำขอที่มีลักษณะเป็นเอเจนต์: โทเค็นอินพุต 150,000 โทเค็น โดย 50,000 โทเค็นให้บริการจากแคช และคำตอบ 4,000 โทเค็น ด้วยอัตราคิดลดของ Meituan การเรียกนั้นมีค่าใช้จ่าย $0.0501 ด้วยอัตราตามรายการของ Qwen3.8-Max การเรียกเดียวกันมีค่าใช้จ่าย $0.3365 — มากกว่า 6.7 เท่า หรือ $50 เทียบกับ $337 สำหรับการเรียกหนึ่งพันครั้งต่อวัน เมื่อปรับให้ส่วนผสมเป็นแคชทั้งหมด ซึ่งเป็นสภาวะคงตัวสำหรับพรอมต์ที่ทำซ้ำ อัตราส่วนจะขยายเป็น 12.3 เท่า: $0.006 เทียบกับ $0.074 ต่อการเรียก
ไม่มีอะไรในการคำนวณทางเลขคณิตนั้นที่ขึ้นอยู่กับว่า LongCat-2.5-Preview ดีหรือไม่ นั่นแหละคือปัญหาพอดี ตัวคูณที่คุณได้รับข้อเสนอมานั้นเป็นของจริง และคำที่แนบมากับมันบนหน้าของผู้ขายเองคือ “limited-time” โดยไม่มีวันสิ้นสุดและไม่มีราคาของรุ่นสืบทอดที่ระบุไว้ ส่วนลด 6.7 เท่าที่ไม่มีการประกาศวันหมดอายุ คือรายการงบประมาณที่คุณใส่ลงในแผนไม่ได้; มันคือรายการงบประมาณที่คุณต้องเฝ้าจับตา
ยังมีความไม่สมมาตรด้านการกำหนดเส้นทาง (routing) ที่ควรพูดให้ตรง ๆ อีกอย่างหนึ่ง Qwen3.8-Max เป็นเส้นทางที่เราให้บริการ — qwen/qwen3.8-max และเวอร์ชันที่ปักหมุดไว้ qwen/qwen3.8-max-0902 — ในราคาของ Alibaba ราคาป้ายโดยไม่บวกเพิ่มเลย ดังนั้นหากผู้ขายปรับราคา ผลก็จะตกมาถึงฝั่งเราภายในวันเดียวกัน ไม่ใช่รอเป็นสัปดาห์ ส่วน LongCat-2.5-Preview ไม่ใช่หนึ่งในเส้นทางที่เราให้บริการ และเราจะไม่แสร้งทำเป็นอย่างอื่น ในฝั่งที่ถูกกว่าของการเปรียบเทียบนี้ คุณกำลังติดต่อกับ API ของ Meituan เอง และแพลตฟอร์มใดก็ตามที่คุณใช้เข้าถึงมัน
ข้อกล่าวอ้างเดียวที่ API ของ Meituan เองหักล้าง
นี่คือข้อค้นพบที่ควรตัดสินผลการเปรียบเทียบสำหรับทุกคนที่ภาระงานไม่ใช่ข้อความล้วน
บันทึกการเปลี่ยนแปลงของ Meituan ระบุว่าความเข้าใจภาพเป็นไฮไลต์ที่เพิ่มเข้ามาในรุ่น 2.5: “ความเข้าใจแบบมัลติโมดัล: ความสามารถใหม่ในการเข้าใจภาพ สามารถแยกวิเคราะห์เนื้อหาภาพ รองรับการถาม-ตอบข้ามรูปแบบ การสรุปเนื้อหา และการให้เหตุผลเชิงภาพที่ซับซ้อน” โพสต์บน X ระบุว่า “เป็นมัลติโมดัลโดยกำเนิด” นั่นเป็นคำกล่าวอ้างของผู้ขาย และหากพิจารณาโดยลำพังก็สมเหตุสมผลที่จะนำไปประกอบการตัดสินใจ
จากนั้นเว็บไซต์เอกสารชุดเดียวกันก็เผยแพร่ตัวอย่างการตอบกลับสำหรับการดึงข้อมูลเมตาของโมเดลนั้นเอง และโมเดลที่ส่งกลับมาก็เป็นแบบข้อความล้วน เมื่อดูที่ id "LongCat-2.5-Preview" เพย์โหลดแสดงให้เห็นว่า context_length: 1048576, input_modalities: ["text"], output_modalities: ["text"] และสตริง modality เป็น text->text ไม่มีรายการรูปภาพ ไม่ใช่ในสแนปช็อตเก่า — แต่เป็นในตัวอย่างที่ทำไว้จริงบนหน้าที่จัดทำเอกสารสำหรับ endpoint นี้
![A screenshot of Meituan's LongCat API documentation for the model-retrieval endpoint, showing the worked example response for 'LongCat-2.5-Preview': context_length 1048576, input_modalities ["text"], output_modalities ["text"] and modality "text->text". The word 'text' is visible in red against the grey page.](https://cms.orcarouter.ai/api/media/file/2-1349.png)
นั่นไม่ได้พิสูจน์ว่าโมเดลมองไม่เห็น มันพิสูจน์ว่าผู้ขายยังไม่ได้ทำให้ข้อความของตนสอดคล้องกับสคีมา API ของตัวเอง และหมายความว่าผู้ซื้อไม่สามารถเรียกเก็บค่าเวิร์กโหลดด้าน vision โดยอ้างอิงจากประโยคในบันทึกการเปลี่ยนแปลงนั้นได้จนกว่าจะมีใครสะสางมัน ลองวางมันเทียบกับอีกด้าน: แค็ตตาล็อกของเราระบุว่า Qwen3.8-Max รองรับอินพุตข้อความ รูปภาพ และวิดีโอ โดยมี vision อยู่ในความสามารถที่ประกาศไว้ และมีตารางเบนช์มาร์กอิสระอยู่เบื้องหลังโมเดลนี้ หากงานของคุณคือการทำความเข้าใจเอกสาร การคัดแยกภาพหน้าจอ หรือการวิเคราะห์เฟรมวิดีโอ คอลัมน์ที่แพงคือคอลัมน์ที่มีรูปแบบอินพุตที่ตรวจสอบยืนยันแล้ว และคอลัมน์ที่ถูกคือคอลัมน์ที่มีรูปแบบอินพุตที่ยังไม่ได้ข้อยุติ แถวเดียวนั้นสามารถลบ 6.7× ทั้งหมดได้
สิ่งที่ Preview ไม่สามารถถูกปักหมุดไว้กับได้
Alibaba ปล่อยสแนปช็อตที่ระบุวันที่กำกับไว้ qwen/qwen3.8-max-0902เป็นบิลด์ที่ตั้งชื่อไว้และถูกฟิกซ์ไว้ ในราคา $2/$6 เท่ากับโมเดลฐาน ซึ่งหมายความว่ากฎการจัดเส้นทางที่ระบุชื่อนี้จะยังคืนค่าน้ำหนักชุดเดิมในเดือนหน้า การเปลี่ยนแปลงด้านพฤติกรรมจะมาในรูปแบบของ id ใหม่ที่คุณเลือกนำมาใช้ได้ตามกำหนดเวลาของคุณเอง
LongCat-2.5-Preview ไม่มี handle แบบนั้น model id คือ preview id ไม่มีคำต่อท้าย snapshot ไม่มีประวัติเวอร์ชันบนแพลตฟอร์ม และไม่มีรายการ changelog ที่จะบอกคุณว่า weights เปลี่ยนไปแล้ว — มีเพียงว่าส่วนลดนั้นเป็นแบบ "limited-time" เท่านั้น มันเป็น preview ในความหมายปกติ: สิ่งที่อยู่ใต้ชื่อนี้อนุญาตให้เปลี่ยนแปลงได้ และคุณจะรู้เรื่องนั้นจากเอาต์พุตของคุณเอง มากกว่าจาก release note
วิธีที่ถูกที่สุดในการซื้อหลักฐานที่ขาดหายไป คือช่วงเวลาที่ Meituan เปิดไว้ในอีกด้านหนึ่งของเรื่องนี้: OpenCode ระบุว่า LongCat-2.5-Preview ฟรีในช่วงเวลาจำกัด โดยผู้ให้บริการปฏิบัติตามนโยบายไม่เก็บข้อมูลเลย (zero-retention) และไม่นำข้อมูลของคุณไปใช้ฝึกโมเดล และเมื่อวันที่ 26 กันยายนที่ผ่านมาได้ระบุว่าช่วงเวลานี้จะยาวสองสัปดาห์ อินพุตฟรี เอาต์พุตฟรี การอ่านแคชฟรี นั่นเป็นวิธีที่ชอบธรรมในการสร้างตาราง benchmark ที่ยังไม่มีใครเผยแพร่ — ลองรันชุดข้อมูลประเมินของคุณเองกับมัน แล้วคุณจะได้ตัวเลขตรงจุดที่ผู้ขายให้ได้แค่ประโยคเดียว สิ่งที่มันไม่ใช่คือราคาที่คุณวางแผนรอบ ๆ ได้: สองสัปดาห์ก็จบลง และตัวเลขในอีกด้านหนึ่งของช่วงนั้นเป็นสิ่งที่ Meituan เป็นผู้กำหนด
ใครควรเลือกอันไหน
หันมาใช้ Qwen3.8-Max เมื่อปริมาณงานคือเหตุผลที่คุณซื้อโมเดลนี้ตั้งแต่แรก หากอินพุตเป็นภาพหรือวิดีโอ หากคำตอบต้องสามารถทำซ้ำได้จากบิลด์หนึ่งไปยังอีกบิลด์หนึ่ง หากดัชนีอิสระเป็นข้อกำหนดด้านการจัดซื้อ หรือหากงานเป็นงานเขียนโค้ดแบบเอเจนต์ชนิดที่ Terminal-Bench และ Coding Index เป็นตัวแทนวัด 6.7× คือราคาที่ต้องจ่ายเพื่อให้สามารถตรวจสอบงานของคุณได้ บนคีย์หนึ่ง มันยังอยู่เบื้องหลังห่วงโซ่สำรอง ดังนั้นโมเดลที่ได้คะแนนแล้วสามารถรองรับวันที่แย่ของโมเดลที่ยังไม่ได้คะแนนได้ โดยที่คุณไม่ต้องรันการผสานรวมสองชุด

เลือกใช้ LongCat-2.5-Preview เมื่องานมีปริมาณสูง บริบทสั้น เป็นข้อความล้วน และใช้ภายใน — การจำแนกประเภท การสกัดข้อมูล การสรุปความ การเขียนใหม่จำนวนมาก — และเมื่อต้นทุนของการผิดพลาดคือการลองใหม่ ไม่ใช่ลูกค้า ในลักษณะงานแบบนั้น บรรทัดอินพุตที่แคชไว้ไม่ใช่ส่วนลด แต่เป็นเศรษฐศาสตร์ทั้งหมดของงาน และ 42× เป็นตัวเลขที่คุ้มค่ากับความพยายามในการวัด ใช้ช่วงเวลาฟรีเพื่อสร้าง benchmark ที่ยังไม่มี อย่าย้าย critical path มาไว้บนมัน
สิ่งที่จะเปลี่ยนคำตัดสินนี้ เรียงตามน้ำหนักความสำคัญ: การประเมินที่เป็นอิสระของ LongCat-2.5-Preview; วันที่สิ้นสุดและราคาของรุ่นสืบทอดที่ประกาศไว้สำหรับส่วนลด; ประวัติเวอร์ชันที่มีสแนปช็อตระบุวันที่; และข้อยุติว่ารายการมอดาลิตีเป็นข้อความเท่านั้นหรือไม่ สิ่งใดสิ่งหนึ่งในนั้นทำให้คอลัมน์ราคาถูกเป็นมากกว่าส่วนลด จนกว่าอย่างน้อยหนึ่งอย่างจะเกิดขึ้น การเปรียบเทียบนี้ไม่ใช่การดวลกันระหว่างสองโมเดล — แต่เป็นการดวลกันระหว่างราคาที่คุณยืนยันได้กับความสามารถที่คุณยืนยันไม่ได้

การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
