
LongCat-2.5-Preview vs Kimi K3: Câu hỏi về truy hồi ngữ cảnh dài mà chưa ai có thể trả lời
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 610 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 189 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
Kimi K3 đạt 88,67 điểm trên Long-Context Recall. Đó là con số cao nhất trong toàn bộ danh mục của chúng tôi cho đúng câu hỏi liệu một mô hình có còn sử dụng thông tin bị chôn sâu trong một đầu vào dài hay không. LongCat-2.5-Preview hoàn toàn không có điểm Long-Context Recall — không từ Artificial Analysis, không từ Meituan, không từ bất kỳ ai. Vậy mà LongCat-2.5-Preview lại chính là mô hình đang quảng cáo cửa sổ một triệu token như tính năng chủ đạo. Sự lệch pha đó — một mô hình lấy ngữ cảnh dài làm tuyên bố trung tâm mà lại không hề tồn tại phép đo ngữ cảnh dài nào dành cho nó — chính là toàn bộ nội dung của so sánh này. Mọi thứ khác đều thứ yếu.
Cần phải chính xác về việc con số còn thiếu có nghĩa gì và không có nghĩa gì, vì rất dễ trượt từ "chưa được đo lường" sang "có lẽ là tệ", và cả hai hướng đều không có cơ sở.
Hai mô hình đã chính thức công bố điều gì
Kimi K3 của MoonshotAI ra mắt ngày 15 tháng 7 năm 2026. Danh mục của chúng tôi cung cấp mô hình này với cửa sổ ngữ cảnh 1.048.576 token, đầu vào dạng văn bản và hình ảnh, cùng bảng giá 3,00 USD mỗi triệu token đầu vào, 0,30 USD mỗi triệu token đầu vào được lưu đệm và 15,00 USD mỗi triệu token đầu ra. Hồ sơ đánh giá độc lập của mô hình từ Artificial Analysis như sau: Chỉ số Lập trình 76,2, xếp thứ chín; Chỉ số Trí tuệ 43,6, xếp thứ mười chín; GPQA Diamond 93,5%; Humanity's Last Exam 46,9%; SciCode 59,5%; Terminal-Bench v2.1 85,0; τ²-Bench banking 46,0. Và Long-Context Recall 88,67, mức tốt nhất trong danh mục của chúng tôi.

LongCat-2.5-Preview của Meituan đã xuất hiện trên Nền tảng API LongCat vào ngày 25 tháng 9 năm 2026. Mục nhật ký thay đổi của nó nêu ba khả năng được tuyên bố — hiểu hình ảnh, lập trình, và tương thích với "Claude Code và các môi trường phát triển phổ biến khác", liệt kê Hermes, OpenClaw, OpenCode và Kilo Code. Trang định giá đưa ra mức 0,30 USD cho mỗi triệu token đầu vào không lưu đệm, 0,006 USD cho mỗi triệu token đầu vào đã lưu đệm và 1,20 USD cho mỗi triệu token đầu ra, được đánh dấu là ưu đãi có thời hạn. Cửa sổ ngữ cảnh 1.000.000; đầu ra tối đa 131.072. Con số ~1,6T tổng / ~48B tham số hoạt động đến từ siêu dữ liệu trang web của Meituan và các bài viết chuyên ngành Trung Quốc, không phải từ tài liệu chính thức. Không có bảng đánh giá chuẩn, không có thẻ mô hình, không có báo cáo kỹ thuật, không có kho lưu trữ trên HuggingFace hay trong tổ chức GitHub của Meituan, và siêu dữ liệu danh mục ghi trọng số mở là sai.
Tại sao con số còn thiếu lại quan trọng hơn ở đây so với bất kỳ cuộc đối đầu nào khác
Khả năng ghi nhớ ngữ cảnh dài không chỉ là một điểm số trong vô số điểm số đối với hai mô hình này. Đó là điểm số kiểm tra đúng thứ mà cả hai đều đang bán. Cửa sổ một triệu token là một tuyên bố về năng lực kiến trúc; khả năng ghi nhớ đo lường liệu mô hình vẫn có thể truy xuất và sử dụng một dữ kiện được đặt ở token 900.000 thay vì token 900 hay không. Các nhà cung cấp công bố chỉ số thứ nhất vì đó là một thông số kỹ thuật. Các đơn vị đánh giá độc lập công bố chỉ số thứ hai vì đó là một bài kiểm tra, và hầu hết mô hình không thể hiện tốt ở chỉ số này như kích thước cửa sổ của chúng ngụ ý.
Vậy nên lập trường trung thực thì hẹp hơn vẻ ngoài của nó. Điểm 88.67 của Kimi K3 không có nghĩa Kimi K3 là mô hình ngữ cảnh dài tốt hơn LongCat-2.5-Preview. Nó có nghĩa Kimi K3 là mô hình mà câu hỏi đó đã được đặt ra và đã được trả lời. LongCat-2.5-Preview có thể tốt hơn. Nó có thể tệ hơn đáng kể. Vấn đề là hiện tại không ai ngoài Meituan biết, và một cửa sổ 1M được in trên trang định giá không phải là bằng chứng theo hướng nào cả.

Bức tranh chi phí, với cùng cảnh báo về số học
Theo mức giá niêm yết, LongCat-2.5-Preview rẻ hơn 10 lần đối với đầu vào chưa lưu đệm và rẻ hơn 12,5 lần đối với đầu ra so với Kimi K3. Một lượt đọc 500.000 token ghi trả lại 20.000 token tốn khoảng 1,80 đô la trên Kimi K3 và khoảng 17 xu trên LongCat-2.5-Preview. Cả hai đều là phép tính trên giá niêm yết chứ không phải đo lường thực tế, và con số của LongCat mang thêm một lưu ý mà con số của Kimi không có: Meituan dán nhãn mức giá của chính mình là ưu đãi có thời hạn, nên con số còn lại sau khi ưu đãi kết thúc vẫn chưa biết.
Đặt điều đó đối chiếu với câu hỏi về độ bao phủ. Nếu bạn đang xử lý đầu vào 500.000 token và khả năng truy hồi của mô hình ở độ sâu đó chưa được đo lường, thì chênh lệch chi phí không phải là một khoản tiết kiệm — đó là cái giá của một tỷ lệ thất bại chưa biết. Một yêu cầu 17 xu âm thầm bỏ sót phần liên quan đắt hơn một yêu cầu 1,80 đô la tìm thấy nó, vì dù thế nào bạn vẫn phải trả tiền cho lần chạy lại và việc gỡ lỗi. Đây là hình dạng cụ thể của rủi ro, và đó là lý do vì sao benchmark còn thiếu là một vấn đề chi phí chứ không chỉ là một vấn đề tiếp thị.
Phải làm gì khi số không tồn tại
Hãy tự tạo lấy một cái. Đây là trường hợp hiếm hoi mà khung miễn phí thực sự rất hợp với khoảng trống này: LongCat-2.5-Preview không tốn gì khi gọi qua OpenCode trong một khoảng thời gian không nêu rõ độ dài, với chính sách không lưu trữ mà OpenCode có tài liệu ghi rõ — huấn luyện mô hình "Không sử dụng", lưu trữ dữ liệu "0 ngày" — nghĩa là bạn có thể trỏ nó vào một kho lưu trữ riêng tư mà không cần trao đổi về xử lý dữ liệu trước. Hãy dựng một bài kiểm tra kiểu kim trong đống cỏ ở đúng độ sâu mà bạn thực sự dùng, chạy nó trên cả hai mô hình, và bạn sẽ có con số mà cả hai nhà cung cấp đều chưa từng công bố. Có hai điều cần kiểm tra trước khi bạn tin vào kết quả: rằng khung kiểm thử của bạn có làm nổi bật trường reasoning_content xen kẽ mà mô hình trả về hay không, và rằng đầu vào hình ảnh có hoạt động được chút nào không, vì nhật ký thay đổi của Meituan khẳng định là có trong khi ví dụ "Retrieve Model" của chính họ vẫn hiển thị input_modalities là ["text"] với một chuỗi text->text.

Phần của OrcaRouter trong cái này
Chúng tôi cung cấp Kimi K3 với giá niêm yết của MoonshotAI và không tính thêm phụ phí. LongCat-2.5-Preview không nằm trong các tuyến của chúng tôi — chúng tôi không cung cấp nó, và không có nội dung nào trong bài viết này nên được hiểu là chúng tôi có cung cấp.
Trong phép so sánh cụ thể này, phần hữu ích của một router không nằm ở giá. Mà ở chỗ mô hình bạn đang đánh giá và mô hình bạn đang dựa vào có thể nằm sau cùng một khóa. Độ recall 88,67 của Kimi K3 khiến nó trở thành mô hình mà bạn sẽ định tuyến một lượt ngữ cảnh dài qua đó ngay hôm nay; LongCat-2.5-Preview là mô hình bạn muốn đem ra kiểm chứng đối đầu với nó, bởi nếu độ recall của nó vẫn giữ vững ở mức một phần mười hai giá đầu ra thì kinh tế học của công việc xử lý tài liệu dài sẽ thay đổi. Hợp nhất mô hình chính là cơ chế biến điều đó thành cụ thể thay vì chỉ mang tính lý thuyết: một lượt truy xuất ngữ cảnh dài và một bước tổng hợp cuối cùng có thể là hai mô hình khác nhau trong cùng một yêu cầu, nên mô hình rẻ chưa được đo lường và mô hình đắt đã được đo lường không nhất thiết phải là hoặc cái này hoặc cái kia. Tự động chuyển đổi dự phòng sau đó bao quát trường hợp một trong hai bị suy giảm, điều này quan trọng hơn mức bình thường khi một trong hai ứng viên của bạn không có lịch sử phục vụ nào để bạn có thể kiểm tra.
Phán quyết, được nêu ra cùng với sự không chắc chắn của chính nó đi kèm
Nếu bạn cần công việc ngữ cảnh dài phải đáng tin cậy trong tuần này, Kimi K3 là lựa chọn có thể bảo vệ được: độ thu hồi 88,67 là con số tốt nhất hiện có cho đúng năng lực đang được đề cập, và hồ sơ tổng thể rộng hơn của nó — Coding 76,2, Intelligence 43,6, GPQA Diamond 93,5% — là vững chắc chứ không ngoạn mục, tất cả đều có nguồn độc lập. Nếu bạn sẵn sàng dành một buổi chiều để tự tạo đánh giá của riêng mình, LongCat-2.5-Preview là canh bạc thú vị hơn: cửa sổ một triệu token, mức trần đầu ra 131,072 token, quyền truy cập không lưu giữ dữ liệu và biểu giá thấp hơn Kimi K3 một bậc độ lớn, tất cả đều dựa trên các tuyên bố của nhà cung cấp mà chưa ai từng kiểm chứng công khai.
Điều không thể biện minh là coi chúng tương đương chỉ vì cả hai đều liệt kê một triệu token. Một trong số chúng có một con số gắn với cửa sổ đó, còn cái kia có một mức giá. Đó là những loại bằng chứng khác nhau, và khoảng cách giữa chúng chính là điều duy nhất mà sự so sánh này thực sự nói tới.
