Một thẻ tiêu đề hero được tạo với nội dung 'LongCat-2.5-Preview vs Grok 4.6' cùng overline 'Một bên có thẻ benchmark, bên kia có phiên bản kế nhiệm', và hai panel: 'LongCat-2.5-Preview: ngữ cảnh 1M, không lưu trữ qua OpenCode' và 'Grok 4.6: AA Coding 76.8, Grok 4.7 đã phát hành'. Logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

LongCat-2.5-Preview vs Grok 4.6: Một bên có thẻ điểm chuẩn, một bên có bản kế nhiệm

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

So sánh LongCat-2.5-Preview với Grok 4.6 là một việc khó xử vì một lý do không liên quan gì đến chất lượng của cả hai mô hình: câu hỏi này có hạn sử dụng. Grok 4.6 ra mắt ngày 12 tháng 8 năm 2026 và Grok 4.7 ra mắt ngày 21 tháng 9 năm 2026 — sáu ngày trước thời điểm bài viết này được thực hiện — với cùng mức giá 2,00 USD / 6,00 USD mỗi triệu token và cùng cửa sổ ngữ cảnh 500.000 token. Trong khi đó, LongCat-2.5-Preview lại xuất hiện trên Nền tảng API LongCat của Meituan vào ngày 25 tháng 9 năm 2026, không hề có phiên bản kế nhiệm nào được công bố và cũng chẳng có benchmark nào được công bố. Vậy nên lựa chọn thực sự không phải là "mô hình nào tốt hơn". Mà là liệu bạn muốn một năng lực đã được đo lường với một phiên bản kế nhiệm cũng đã được đo lường đang đứng ngay phía sau, hay một năng lực chưa được đo lường nhưng ít nhất là thứ hiện hành.

Cách diễn đạt đó kém phần thú vị so với một bảng tỷ số nhưng lại hữu ích hơn đáng kể.

Hãy bắt đầu với những gì Grok 4.6 thực sự đang có trong hồ sơ

Grok 4.6 là một mô hình được ghi liệu đầy đủ. Trên danh mục của chúng tôi, nó sở hữu cửa sổ ngữ cảnh 500.000 token, hỗ trợ đầu vào dạng văn bản, hình ảnh và tệp, cùng bảng giá $2,00 mỗi triệu token đầu vào, $6,00 mỗi triệu token đầu ra và $0,50 mỗi triệu token đầu vào được lưu đệm, tăng lên $4,00 và $12,00 khi vượt quá 200.000 token đầu vào. Hồ sơ độc lập của nó từ Artificial Analysis bao gồm Chỉ số Lập trình là 76,8 — đứng thứ năm trong số các mô hình mà chỉ số đó theo dõi — Chỉ số Thông minh là 44,3 ở vị trí thứ mười tám, GPQA Diamond đạt 94,9%, Humanity's Last Exam đạt 42,9%, SciCode đạt 56,5%, Terminal-Bench v2.1 đạt 88,4 và τ²-Bench cho lĩnh vực ngân hàng đạt 50,7. Khả năng Truy hồi Ngữ cảnh Dài của nó là 80,3.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

LongCat-2.5-Preview không có bất kỳ điều nào trong số đó. Mục nhật ký thay đổi của Meituan cho ngày 25 tháng 9 năm 2026 là một thông báo khả dụng có ghi ngày, liệt kê ba năng lực được tuyên bố — hiểu hình ảnh, lập trình và khả năng tương thích với "Claude Code và các môi trường phát triển phổ biến khác" bao gồm Hermes, OpenClaw, OpenCode và Kilo Code — và không có gì giống như một kết quả. Trang định giá của nhà cung cấp đưa ra mức $0.30 cho mỗi triệu đầu vào không được lưu trong bộ đệm, $0.006 cho mỗi triệu đầu vào được lưu trong bộ đệm và $1.20 cho mỗi triệu đầu ra, được ghi rõ là ưu đãi giảm giá có thời hạn. Cửa sổ ngữ cảnh là 1.000.000 token; đầu ra tối đa là 131.072. Số lượng tham số tổng khoảng 1,6 nghìn tỷ / 48 tỷ tham số hoạt động đến từ siêu dữ liệu trang web của Meituan và các bài đưa tin chuyên ngành Trung Quốc chứ không phải từ tài liệu. Không có kho lưu trữ nào cho nó trên HuggingFace hoặc trong tổ chức GitHub của Meituan, và siêu dữ liệu danh mục mà OpenCode phát hành ghi trọng số mở là false.

Khía cạnh mà một bảng điểm sẽ bỏ sót hoàn toàn

Hai mô hình này khác nhau ở một điểm mà không benchmark nào đo được, và với nhiều đội nhóm, nó tự quyết định câu hỏi: điều gì xảy ra với những prompt bạn gửi đi.

Tài liệu của chính OpenCode nêu rằng LongCat 2.5 Preview Free được cung cấp bởi một nhà cung cấp tuân thủ chính sách không lưu trữ dữ liệu và không sử dụng dữ liệu của bạn để huấn luyện; bảng quyền riêng tư Zen đưa ra con số cụ thể cho điều đó — huấn luyện mô hình "Không sử dụng", lưu trữ dữ liệu "0 ngày". Bảng quyền riêng tư đó cũng liệt kê thời gian lưu trữ ba mươi ngày đối với Grok 4.6 và Grok 4.7. Cả hai phát biểu đó đều là của OpenCode, được công bố trên các trang của OpenCode, và chúng mô tả cụ thể danh mục miễn phí và danh mục so sánh. Nhưng nếu bạn đang hướng một agent vào một kho lưu trữ riêng tư, thì đó là sự khác biệt giữa một cuộc trò chuyện mà bạn không cần phải có với bộ phận pháp lý và một cuộc trò chuyện mà bạn phải có — và điều đó chẳng liên quan gì đến việc mô hình nào đạt điểm cao hơn trên SciCode.

A screenshot of OrcaRouter's own model page for xAI Grok 4.6 at /models/grok/grok-4.6, showing the grok/grok-4.6 identifier, a 500K-token context window, text + image + file input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-08-12, $2.00 and $6.00 rate tiles, and a performance strip whose first-token and token-traffic tiles both read 'Collecting' rather than a figure. The page copy describes Grok 4.6 as the current flagship of the Grok line and cites a headline GPQA Diamond score of 94.9.

“Measured” mang lại cho bạn điều gì và không mang lại điều gì

Các số liệu của Grok 4.6 tốt hơn của LongCat-2.5-Preview theo khía cạnh duy nhất thực sự quan trọng ở đây: chúng tồn tại. Điều đó không đồng nghĩa với việc nói Grok 4.6 là mô hình tốt hơn. Chỉ số Coding Index 76,8 của nó thấp hơn chỉ số của thế hệ Grok 4.7, và mô hình mà nó được đem ra so sánh không còn là mô hình tiên phong trong chính dòng của nó nữa. Mô hình kế nhiệm đã được công bố của nó có Intelligence Index là 46,4 so với 44,3 của Grok 4.6, và Long-Context Recall là 76,67 so với 80,33 của Grok 4.6 — vậy nên mô hình kế nhiệm không tốt hơn trên mọi trục, đúng kiểu chi tiết mà một con số thế hệ che giấu.

Ngoài ra còn một lưu ý về phục vụ trực tiếp đáng nói thẳng ra, bởi nó đi ngược lại cách diễn giải có lợi cho cả hai mô hình. Trên mẫu playground bảy ngày của chính chúng tôi, Grok 4.6 không ghi nhận thông lượng đo được nào và không có lưu lượng token nào, đó là dấu hiệu của việc thiếu dữ liệu ở cột đó chứ không phải một phán quyết về hiệu năng. LongCat-2.5-Preview hoàn toàn không có mẫu phục vụ nào của chúng tôi, vì chúng tôi không định tuyến nó. Vậy nên mọi so sánh độ trễ giữa hai mô hình này đều phiến diện theo cái cách mà lời văn thường lấp liếm: bạn không thể đánh giá chuẩn một mô hình mà bạn không gửi lưu lượng đến.

Nơi mà lớp định tuyến thực sự phát huy tác dụng ở đây

Ba trong số những dữ kiện trên thuộc loại mà một router được thiết kế để xử lý, chứ không chỉ đơn thuần là tương thích. Bảng giá của Grok 4.6 tăng bậc khi vượt 200.000 token đầu vào, nên cùng một tác vụ logic có thể bị tính phí theo hai mức khác nhau tùy thuộc vào một con số mà ứng dụng của bạn đã biết trước khi gửi bất cứ thứ gì. Grok 4.6 có một phiên bản kế nhiệm đã được công bố với mức giá y hệt, nghĩa là việc chuyển từ phiên bản này sang phiên bản kia chỉ nên là thay đổi một dòng và không bao giờ phải tích hợp lại. Và thuộc tính hấp dẫn nhất của LongCat-2.5-Preview — giá của nó — được nhà cung cấp ghi rõ là tạm thời.

Trên OrcaRouter chúng tôi cung cấp Grok 4.6 với giá niêm yết của xAI cùng mức markup bằng không, nên khi nhà cung cấp thay đổi mức giá, hóa đơn của bạn nhận được thay đổi ngay trong ngày thay vì vào kỳ gia hạn kế tiếp, và cơ chế chuyển đổi dự phòng tự động sẽ đưa một yêu cầu bị suy giảm sang một nhà cung cấp khỏe mạnh mà mã của bạn không hề biết ai đã phản hồi. Một DSL định tuyến xử lý trực tiếp trường hợp định giá theo bậc, còn hợp nhất mô hình xử lý trường hợp mô hình bạn muốn dùng cho lượt đọc dài không phải là mô hình bạn muốn dùng cho bước tổng hợp cuối cùng. LongCat-2.5-Preview không nằm trong các tuyến của chúng tôi — chúng tôi không cung cấp nó, và không có gì ở đây khẳng định điều ngược lại. Việc nêu tên nó ra không nhằm hướng bạn sang nơi khác; mà là một mô hình bạn đang đánh giá chứ chưa chạy nên nằm sau cùng một khóa như những mô hình bạn đang chạy, để việc đánh giá nó chỉ tốn một mục cấu hình thay vì cả một dự án.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs Grok 4.6' with the subhead 'One model has a measured card and a measured successor; the other has a rate card'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, coding index not published, long-context recall not published, data retention 0 days on the free listing per OpenCode. Right column 'Grok 4.6' (xAI, released 2026-08-12, successor shipped 2026-09-21): 500,000-token context, max output not published, text, image and file to text, $2.00 input up to 200K then $4.00, $6.00 output up to 200K then $12.00, coding index 76.8 at rank 5 by Artificial Analysis, long-context recall 80.33, data retention 30 days on the comparison listing per OpenCode. Footnote credits the left column to Meituan's changelog and pricing page and the right column to OrcaRouter's catalogue with index figures sourced to Artificial Analysis, and notes that LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

Cách quyết định

• Chọn Grok 4.6 nếu bạn cần một câu trả lời mà mình có thể đứng ra bảo vệ. Nó có một thẻ độc lập, một hồ sơ đầu vào được ghi chép đầy đủ, và một mức giá không hết hạn. Rủi ro chính của nó không nằm ở chất lượng mà ở tính phù hợp: Grok 4.7 đã tồn tại với cùng mức giá, và cái giá của việc cứ quán tính bám trụ ở 4.6 chính là khoảng cách giữa Chỉ số Thông minh 44.3 và 46.4 mà lẽ ra bạn không phải trả.

• Hãy chọn LongCat-2.5-Preview nếu yếu tố quyết định là khả năng lưu trữ dữ liệu hoặc phạm vi tiếp cận. Truy cập không lưu trữ dữ liệu thông qua OpenCode, cửa sổ một triệu token, giới hạn đầu ra 131.072 token và bảng giá chỉ bằng khoảng một phần bảy của Grok 4.6 là những lợi thế thực sự — lợi thế đầu tiên trong số đó được xác minh bởi chính sách quyền riêng tư của bên thứ ba, phần còn lại chỉ do nhà cung cấp tự khẳng định.

• Đừng chọn giữa chúng dựa vào một bảng benchmark, vì chỉ có một bảng như vậy tồn tại. Điểm lập trình 76,8 và điểm nhớ lại ngữ cảnh dài 80,3 của Grok 4.6 mô tả Grok 4.6. Hiện vẫn chưa có gì mô tả LongCat-2.5-Preview. Bất kỳ ai trong tuần này công bố điểm LongCat-2.5-Preview bên cạnh điểm Grok 4.6 thì hoặc là đang trích dẫn một mô hình LongCat khác, hoặc là đang bịa ra con số đó.

• Hãy xác minh phía đầu vào trước khi bạn xây dựng dựa trên nó. Nhật ký thay đổi của Meituan mở đầu bằng khả năng hiểu hình ảnh, nhưng phản hồi ví dụ trong tài liệu "Retrieve Model" của chính họ vẫn hiển thị input_modalities là ["text"] với một text->text chuỗi modality — được nhà cung cấp tuyên bố trái với một hợp đồng đã công bố nói khác. Grok 4.6 nhận văn bản, hình ảnh và tệp mà không có sự mơ hồ như vậy. Và hãy kiểm tra rằng harness của bạn hiển thị một trường reasoning_content xen kẽ trước khi bạn kết luận bất cứ điều gì về chất lượng suy luận của LongCat-2.5-Preview; một client bỏ qua trường đó sẽ thất bại một cách âm thầm.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày