Thẻ tiêu đề hero được tạo tự động với nội dung 'LongCat-2.5-Preview vs Kimi K3', dòng trên cùng là 'Câu hỏi về khả năng ghi nhớ ngữ cảnh dài', và hai khung: 'LongCat-2.5-Preview: ngữ cảnh 1M, điểm ghi nhớ không được công bố' và 'Kimi K3: AA Long-Context Recall 88.67, mức cao nhất mà chúng tôi cung cấp'. Logo OrcaRouter ở góc dưới bên phải.
Engineering & Research

LongCat-2.5-Preview vs Kimi K3: Câu hỏi về truy hồi ngữ cảnh dài mà chưa ai có thể trả lời

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Kimi K3 đạt 88,67 điểm trên Long-Context Recall. Đó là con số cao nhất trong toàn bộ danh mục của chúng tôi cho đúng câu hỏi liệu một mô hình có còn sử dụng thông tin bị chôn sâu trong một đầu vào dài hay không. LongCat-2.5-Preview hoàn toàn không có điểm Long-Context Recall — không từ Artificial Analysis, không từ Meituan, không từ bất kỳ ai. Vậy mà LongCat-2.5-Preview lại chính là mô hình đang quảng cáo cửa sổ một triệu token như tính năng chủ đạo. Sự lệch pha đó — một mô hình lấy ngữ cảnh dài làm tuyên bố trung tâm mà lại không hề tồn tại phép đo ngữ cảnh dài nào dành cho nó — chính là toàn bộ nội dung của so sánh này. Mọi thứ khác đều thứ yếu.

Cần phải chính xác về việc con số còn thiếu có nghĩa gì và không có nghĩa gì, vì rất dễ trượt từ "chưa được đo lường" sang "có lẽ là tệ", và cả hai hướng đều không có cơ sở.

Hai mô hình đã chính thức công bố điều gì

Kimi K3 của MoonshotAI ra mắt ngày 15 tháng 7 năm 2026. Danh mục của chúng tôi cung cấp mô hình này với cửa sổ ngữ cảnh 1.048.576 token, đầu vào dạng văn bản và hình ảnh, cùng bảng giá 3,00 USD mỗi triệu token đầu vào, 0,30 USD mỗi triệu token đầu vào được lưu đệm và 15,00 USD mỗi triệu token đầu ra. Hồ sơ đánh giá độc lập của mô hình từ Artificial Analysis như sau: Chỉ số Lập trình 76,2, xếp thứ chín; Chỉ số Trí tuệ 43,6, xếp thứ mười chín; GPQA Diamond 93,5%; Humanity's Last Exam 46,9%; SciCode 59,5%; Terminal-Bench v2.1 85,0; τ²-Bench banking 46,0. Và Long-Context Recall 88,67, mức tốt nhất trong danh mục của chúng tôi.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

LongCat-2.5-Preview của Meituan đã xuất hiện trên Nền tảng API LongCat vào ngày 25 tháng 9 năm 2026. Mục nhật ký thay đổi của nó nêu ba khả năng được tuyên bố — hiểu hình ảnh, lập trình, và tương thích với "Claude Code và các môi trường phát triển phổ biến khác", liệt kê Hermes, OpenClaw, OpenCode và Kilo Code. Trang định giá đưa ra mức 0,30 USD cho mỗi triệu token đầu vào không lưu đệm, 0,006 USD cho mỗi triệu token đầu vào đã lưu đệm và 1,20 USD cho mỗi triệu token đầu ra, được đánh dấu là ưu đãi có thời hạn. Cửa sổ ngữ cảnh 1.000.000; đầu ra tối đa 131.072. Con số ~1,6T tổng / ~48B tham số hoạt động đến từ siêu dữ liệu trang web của Meituan và các bài viết chuyên ngành Trung Quốc, không phải từ tài liệu chính thức. Không có bảng đánh giá chuẩn, không có thẻ mô hình, không có báo cáo kỹ thuật, không có kho lưu trữ trên HuggingFace hay trong tổ chức GitHub của Meituan, và siêu dữ liệu danh mục ghi trọng số mở là sai.

Tại sao con số còn thiếu lại quan trọng hơn ở đây so với bất kỳ cuộc đối đầu nào khác

Khả năng ghi nhớ ngữ cảnh dài không chỉ là một điểm số trong vô số điểm số đối với hai mô hình này. Đó là điểm số kiểm tra đúng thứ mà cả hai đều đang bán. Cửa sổ một triệu token là một tuyên bố về năng lực kiến trúc; khả năng ghi nhớ đo lường liệu mô hình vẫn có thể truy xuất và sử dụng một dữ kiện được đặt ở token 900.000 thay vì token 900 hay không. Các nhà cung cấp công bố chỉ số thứ nhất vì đó là một thông số kỹ thuật. Các đơn vị đánh giá độc lập công bố chỉ số thứ hai vì đó là một bài kiểm tra, và hầu hết mô hình không thể hiện tốt ở chỉ số này như kích thước cửa sổ của chúng ngụ ý.

Vậy nên lập trường trung thực thì hẹp hơn vẻ ngoài của nó. Điểm 88.67 của Kimi K3 không có nghĩa Kimi K3 là mô hình ngữ cảnh dài tốt hơn LongCat-2.5-Preview. Nó có nghĩa Kimi K3 là mô hình mà câu hỏi đó đã được đặt ra và đã được trả lời. LongCat-2.5-Preview có thể tốt hơn. Nó có thể tệ hơn đáng kể. Vấn đề là hiện tại không ai ngoài Meituan biết, và một cửa sổ 1M được in trên trang định giá không phải là bằng chứng theo hướng nào cả.

A screenshot of OrcaRouter's own model page for MoonshotAI Kimi K3 at /models/kimi/kimi-k3, showing the kimi/kimi-k3 identifier, a 1M-token context window, text + image input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-07-15, a p50 first-token figure of 8.24 s, $3.00 and $15.00 rate tiles, and the OpenAI-compatible code samples.

Bức tranh chi phí, với cùng cảnh báo về số học

Theo mức giá niêm yết, LongCat-2.5-Preview rẻ hơn 10 lần đối với đầu vào chưa lưu đệm và rẻ hơn 12,5 lần đối với đầu ra so với Kimi K3. Một lượt đọc 500.000 token ghi trả lại 20.000 token tốn khoảng 1,80 đô la trên Kimi K3 và khoảng 17 xu trên LongCat-2.5-Preview. Cả hai đều là phép tính trên giá niêm yết chứ không phải đo lường thực tế, và con số của LongCat mang thêm một lưu ý mà con số của Kimi không có: Meituan dán nhãn mức giá của chính mình là ưu đãi có thời hạn, nên con số còn lại sau khi ưu đãi kết thúc vẫn chưa biết.

Đặt điều đó đối chiếu với câu hỏi về độ bao phủ. Nếu bạn đang xử lý đầu vào 500.000 token và khả năng truy hồi của mô hình ở độ sâu đó chưa được đo lường, thì chênh lệch chi phí không phải là một khoản tiết kiệm — đó là cái giá của một tỷ lệ thất bại chưa biết. Một yêu cầu 17 xu âm thầm bỏ sót phần liên quan đắt hơn một yêu cầu 1,80 đô la tìm thấy nó, vì dù thế nào bạn vẫn phải trả tiền cho lần chạy lại và việc gỡ lỗi. Đây là hình dạng cụ thể của rủi ro, và đó là lý do vì sao benchmark còn thiếu là một vấn đề chi phí chứ không chỉ là một vấn đề tiếp thị.

Phải làm gì khi số không tồn tại

Hãy tự tạo lấy một cái. Đây là trường hợp hiếm hoi mà khung miễn phí thực sự rất hợp với khoảng trống này: LongCat-2.5-Preview không tốn gì khi gọi qua OpenCode trong một khoảng thời gian không nêu rõ độ dài, với chính sách không lưu trữ mà OpenCode có tài liệu ghi rõ — huấn luyện mô hình "Không sử dụng", lưu trữ dữ liệu "0 ngày" — nghĩa là bạn có thể trỏ nó vào một kho lưu trữ riêng tư mà không cần trao đổi về xử lý dữ liệu trước. Hãy dựng một bài kiểm tra kiểu kim trong đống cỏ ở đúng độ sâu mà bạn thực sự dùng, chạy nó trên cả hai mô hình, và bạn sẽ có con số mà cả hai nhà cung cấp đều chưa từng công bố. Có hai điều cần kiểm tra trước khi bạn tin vào kết quả: rằng khung kiểm thử của bạn có làm nổi bật trường reasoning_content xen kẽ mà mô hình trả về hay không, và rằng đầu vào hình ảnh có hoạt động được chút nào không, vì nhật ký thay đổi của Meituan khẳng định là có trong khi ví dụ "Retrieve Model" của chính họ vẫn hiển thị input_modalities là ["text"] với một chuỗi text->text.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs Kimi K3' with the subhead 'The one model advertising a long window is the one with no recall score'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, long-context recall not published by anyone, coding index not published, no repo and catalogue open_weights false. Right column 'Kimi K3' (MoonshotAI, released 2026-07-15, independently scored): 1,048,576-token context, max output not published, text and image to text, $3.00 uncached / $0.30 cached input, $15.00 output, long-context recall 88.67 described as the highest we carry, coding index 76.2 at rank 9 and intelligence index 43.6 at rank 19 by Artificial Analysis. The footnote adds that a 500,000-token read writing 20,000 tokens back is roughly $1.80 on Kimi K3 against roughly 17 cents on LongCat-2.5-Preview at its published promotional rate. Footnote credits the left column to Meituan's changelog and pricing page and the right column to OrcaRouter's catalogue with index figures sourced to Artificial Analysis, and notes that LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

Phần của OrcaRouter trong cái này

Chúng tôi cung cấp Kimi K3 với giá niêm yết của MoonshotAI và không tính thêm phụ phí. LongCat-2.5-Preview không nằm trong các tuyến của chúng tôi — chúng tôi không cung cấp nó, và không có nội dung nào trong bài viết này nên được hiểu là chúng tôi có cung cấp.

Trong phép so sánh cụ thể này, phần hữu ích của một router không nằm ở giá. Mà ở chỗ mô hình bạn đang đánh giá và mô hình bạn đang dựa vào có thể nằm sau cùng một khóa. Độ recall 88,67 của Kimi K3 khiến nó trở thành mô hình mà bạn sẽ định tuyến một lượt ngữ cảnh dài qua đó ngay hôm nay; LongCat-2.5-Preview là mô hình bạn muốn đem ra kiểm chứng đối đầu với nó, bởi nếu độ recall của nó vẫn giữ vững ở mức một phần mười hai giá đầu ra thì kinh tế học của công việc xử lý tài liệu dài sẽ thay đổi. Hợp nhất mô hình chính là cơ chế biến điều đó thành cụ thể thay vì chỉ mang tính lý thuyết: một lượt truy xuất ngữ cảnh dài và một bước tổng hợp cuối cùng có thể là hai mô hình khác nhau trong cùng một yêu cầu, nên mô hình rẻ chưa được đo lường và mô hình đắt đã được đo lường không nhất thiết phải là hoặc cái này hoặc cái kia. Tự động chuyển đổi dự phòng sau đó bao quát trường hợp một trong hai bị suy giảm, điều này quan trọng hơn mức bình thường khi một trong hai ứng viên của bạn không có lịch sử phục vụ nào để bạn có thể kiểm tra.

Phán quyết, được nêu ra cùng với sự không chắc chắn của chính nó đi kèm

Nếu bạn cần công việc ngữ cảnh dài phải đáng tin cậy trong tuần này, Kimi K3 là lựa chọn có thể bảo vệ được: độ thu hồi 88,67 là con số tốt nhất hiện có cho đúng năng lực đang được đề cập, và hồ sơ tổng thể rộng hơn của nó — Coding 76,2, Intelligence 43,6, GPQA Diamond 93,5% — là vững chắc chứ không ngoạn mục, tất cả đều có nguồn độc lập. Nếu bạn sẵn sàng dành một buổi chiều để tự tạo đánh giá của riêng mình, LongCat-2.5-Preview là canh bạc thú vị hơn: cửa sổ một triệu token, mức trần đầu ra 131,072 token, quyền truy cập không lưu giữ dữ liệu và biểu giá thấp hơn Kimi K3 một bậc độ lớn, tất cả đều dựa trên các tuyên bố của nhà cung cấp mà chưa ai từng kiểm chứng công khai.

Điều không thể biện minh là coi chúng tương đương chỉ vì cả hai đều liệt kê một triệu token. Một trong số chúng có một con số gắn với cửa sổ đó, còn cái kia có một mức giá. Đó là những loại bằng chứng khác nhau, và khoảng cách giữa chúng chính là điều duy nhất mà sự so sánh này thực sự nói tới.