Thẻ tiêu đề hero được tạo tự động với nội dung 'LongCat-2.5-Preview vs GLM-5.2', kèm dòng overline 'Cùng cửa sổ 1M, chỉ một trong hai được đo lường', và hai khung: 'LongCat-2.5-Preview: ngữ cảnh 1M, $0.30 / $1.20 mỗi 1M, không công bố benchmark' và 'GLM-5.2: ngữ cảnh 1M, AA Long-Context Recall 78.33'. Logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

LongCat-2.5-Preview vs GLM-5.2: Hai cửa sổ 1M token, một trong số đó đã được đo lường

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

LongCat-2.5-Preview và GLM-5.2 cùng mang một con số đáng chú ý giống hệt nhau: cửa sổ ngữ cảnh một triệu token. Sự trùng hợp duy nhất ấy đang gánh vác toàn bộ công việc trong hầu hết các so sánh được viết ra trong tuần này, và chỉ riêng nó thì không đủ để so sánh hai mô hình. GLM-5.2 đã được ghi nhận công khai từ ngày 16 tháng 6 năm 2026 với hồ sơ benchmark công khai, bảng giá dịch vụ đã công bố và điểm số ghi nhớ ngữ cảnh dài từ một đơn vị đánh giá độc lập. LongCat-2.5-Preview xuất hiện trên LongCat API Platform của Meituan vào ngày 25 tháng 9 năm 2026 với bảng giá ưu đãi, số lượng tham số do báo chí ngành Trung Quốc đưa tin, và không có bất kỳ benchmark nào được công bố. Một cửa sổ được đo lường. Cái còn lại chỉ được khẳng định. Toàn bộ phần dưới đây giữ tách biệt hai hạng mục đó, bởi vì bảng thông số kỹ thuật và kết quả kiểm thử không phải là cùng một loại dữ kiện.

Đây là phiên bản trung thực của cuộc so tài, và nó hữu ích hơn phiên bản tâng bốc kia.

Những gì mỗi bên thực sự đã công bố

Nhật ký thay đổi của Meituan có một mục ghi ngày — “Phiên bản: 2026-09-25, LongCat-2.5-Preview hiện đã có” — liệt kê ba khả năng được tuyên bố: hiểu hình ảnh, lập trình và tương thích với “Claude Code và các môi trường phát triển phổ biến khác”, nêu tên Hermes, OpenClaw, OpenCode và Kilo Code. Trang định giá của nhà cung cấp nêu mức phí trả theo mức sử dụng là 0,30 đô la cho mỗi triệu token đầu vào chưa lưu đệm, 0,006 đô la cho mỗi triệu token đầu vào đã lưu đệm và 1,20 đô la cho mỗi triệu token đầu ra, được đánh dấu ngay trên chính trang đó là ưu đãi giảm giá có thời hạn. Cửa sổ ngữ cảnh là một triệu token và đầu ra tối đa là 131.072. Khoảng 1,6 nghìn tỷ tham số tổng cộng với khoảng 48 tỷ tham số hoạt động trên mỗi token, trên nền tảng mixture-of-experts, đến từ siêu dữ liệu trên chính trang web của Meituan và từ các bài viết công nghệ Trung Quốc về bản niêm yết này — không phải từ tài liệu API. Không có báo cáo kỹ thuật, không có thẻ mô hình và không có bảng đánh giá chuẩn nào đi kèm với bất kỳ nội dung nào trong số đó. Không có kho lưu trữ LongCat-2.5-Preview trên HuggingFace và không có kho lưu trữ nào cùng tên trong tổ chức GitHub của Meituan; siêu dữ liệu danh mục mô hình đi kèm với OpenCode ghi trọng số mở là false.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

Z.ai's GLM-5.2 nằm ở vị trí ngược lại. Đây là bản phát hành tháng Sáu với bảng giá mà chúng tôi cung cấp theo giá niêm yết: 1,40 USD cho mỗi triệu token đầu vào, 0,26 USD cho mỗi triệu token đầu vào được lưu đệm và 4,40 USD cho mỗi triệu token đầu ra trên danh mục của chúng tôi, với cửa sổ ngữ cảnh 1.000.000 token và đầu ra tối đa 128.000 token. Các điểm số đã công bố của nó đến từ hai nơi khác nhau, và sự phân biệt này rất quan trọng: các con số của chính Z.ai cho AIME 2026, HMMT February 2026, GPQA-Diamond và bộ FrontierSWE là do nhà cung cấp báo cáo; các chỉ số Coding Index và Intelligence Index mà danh mục của chúng tôi hiển thị được lấy từ Artificial Analysis, đơn vị tự thực hiện các đánh giá của mình.

Phương diện duy nhất mà họ thực sự bình đẳng

Cả hai mô hình đều tuyên bố chính xác 1.000.000 token ngữ cảnh. Chỉ một trong số đó có điểm số được công bố để kiểm tra liệu một mô hình còn có thể sử dụng những gì nằm trong đó hay không. Artificial Analysis ghi nhận chỉ số Long-Context Recall là 78,33 cho GLM-5.2. LongCat-2.5-Preview không có con số tương đương, từ bất kỳ ai. Sự bất đối xứng đó chính là toàn bộ cuộc so tài gói trong một dòng: cửa sổ một triệu token là một tuyên bố về năng lực của kiến trúc, chứ không phải về việc mô hình có truy xuất đúng ở token 900.000 hay không. Năng lực thì rẻ để in ra và đắt để xác minh, đó là lý do mọi nhà cung cấp đều in nó ra và gần như không ai trong số họ công bố bài kiểm tra truy hồi.

Vậy nếu công việc ngữ cảnh dài là lý do bạn đang cân nhắc giữa hai lựa chọn này, thì bạn đang chọn giữa một lựa chọn có điểm recall đã công bố và một lựa chọn không có — và lựa chọn không có đó cũng chính là lựa chọn có hồ sơ benchmark chưa được đo lường. Đó không phải là lập luận chống lại nó. Đó là lập luận chống lại việc coi hai cái đó là hoán đổi được cho nhau chỉ dựa trên một số nguyên trùng khớp.

A screenshot of OrcaRouter's own model page for Z.ai GLM-5.2 at /models/z-ai/glm-5.2, showing the z-ai/glm-5.2 identifier, a 1M-token context window, 128K maximum output, text input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-06-16, a p50 first-token figure of 5.13 s, $1.40 and $4.40 rate tiles, and the OpenAI-compatible code samples.

Chênh lệch giá trông như thế nào trong một công việc thực tế

Bảng giá không hề gần nhau, và hướng đi không phải là điều người ta mong đợi từ một đối thủ Trung Quốc theo trọng số mở chống lại một phòng thí nghiệm tiên phong phương Tây. LongCat-2.5-Preview rẻ hơn khoảng 4,7 lần ở đầu vào chưa được lưu đệm và rẻ hơn 3,7 lần ở đầu ra so với GLM-5.2 — một tỷ lệ chỉ là phép tính số học trên hai bảng giá đã công bố, không phải một phép đo. Trong một lượt xử lý tài liệu 500.000 token mà ghi trả lại 20.000 token, con số đó là khoảng 17 xu so với khoảng 79 xu. Cả hai mô hình đều phải đọc cùng một tài liệu. Chỉ một trong số chúng có điểm số được công bố về việc liệu nó có còn chú ý đến cuối tài liệu hay không.

Có một lưu ý thứ hai cần nói cùng lúc: Meituan tự gắn nhãn bảng giá của mình là ưu đãi có thời hạn. Con số $0.30 là con số khuyến mãi, và nhà cung cấp không nói điều gì sẽ đến sau đó. Một mô hình chi phí được xây dựng trên giá khuyến mãi có một ngày hết hạn mà bạn không thể đọc được. Đó là lý do để giữ chi phí chuyển đổi giữa các nhà cung cấp ở mức thấp, chứ không phải lý do để tránh mô hình.

Trên OrcaRouter, các route mà chúng tôi cung cấp nằm sau một key duy nhất với giá niêm yết của nhà cung cấp cùng mức phụ phí bằng không, nên khi nhà cung cấp thay đổi giá, hóa đơn của bạn được cập nhật ngay trong ngày thay vì phải đợi đến kỳ gia hạn tiếp theo, và cơ chế chuyển đổi dự phòng tự động sẽ đưa một yêu cầu bị suy giảm sang một nhà cung cấp khỏe mạnh mà ứng dụng của bạn không hề hay biết. GLM-5.2 là một trong các route của chúng tôi. LongCat-2.5-Preview thì không — chúng tôi không cung cấp mô hình đó, và không có nội dung nào ở đây nên được hiểu là khẳng định điều ngược lại. Z.ai cũng đã tiến xa kể từ tháng 6: GLM-5.3 đã có trên danh mục của chúng tôi kể từ ngày 18 tháng 8 năm 2026, nên một so sánh được đặt trong khuôn khổ "mô hình mới so với mô hình hiện tại" vốn đã định vị GLM-5.2 là mô hình đương nhiệm thay vì mô hình tiên phong.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs GLM-5.2' with the subhead 'Six dimensions, and which side of each one has evidence behind it'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, coding index not published, long-context recall not published, no repo and catalogue open_weights false. Right column 'GLM-5.2' (Z.ai, released 2026-06-16, independently scored): 1,000,000-token context, 128,000 max output, text to text only, $1.40 / $0.26 input, $4.40 output, coding index 68.8 at rank 30, long-context recall 78.33. Footnote credits OrcaRouter's catalogue and Artificial Analysis for the right column and notes LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

Điều gì sẽ giải quyết được việc này, và điều gì sẽ không.

• Điểm Recall Ngữ cảnh Dài cho LongCat-2.5-Preview, từ Meituan hoặc từ một đơn vị đánh giá độc lập. Cho đến khi có được điều đó, cửa sổ 1M của nó chỉ là một tuyên bố không có bài kiểm tra đi kèm, và 78.33 của GLM-5.2 là con số duy nhất trong so sánh nói lên cùng một câu hỏi.

• Bảng giá của nhà cung cấp không có dấu hiệu thời gian có hạn. Mức giá đã giảm cho bạn biết mô hình có giá bao nhiêu trong đợt khuyến mãi, chứ không phải giá thực tế của nó.

• Một bảng benchmark dưới bất kỳ hình thức nào. Không phải vị trí trên bảng xếp hạng — chỉ là một lần chạy đánh giá đã được công bố, để việc so sánh không còn là chuyện bảng thông số kỹ thuật đối chiếu với một trang kết quả.

• Xác nhận về đầu vào hình ảnh. Nhật ký thay đổi giới thiệu khả năng hiểu hình ảnh như một bổ sung nổi bật, nhưng phản hồi ví dụ trong tài liệu "Retrieve Model" của chính Meituan vẫn hiển thị input_modalities là ["text"] với một text->text chuỗi modality. Mẫu đó có thể chỉ đơn giản là đã lỗi thời. Tuy vậy, đây vẫn là hợp đồng đã công bố của nhà cung cấp, nên hãy coi đầu vào hình ảnh là một tuyên bố chứ không phải là tính năng có sẵn. Ngược lại, GLM-5.2 là văn bản vào và văn bản ra trong danh mục của chúng tôi, hoàn toàn không có modality hình ảnh — vì vậy ở khía cạnh này, cả hai mô hình đều không cho bạn câu trả lời đã được xác minh, và một trong số chúng chỉ cho bạn một tuyên bố.

• Số liệu của chính bạn. Khoảng cách giữa những gì được công bố và những gì bạn cần sẽ được thu hẹp bằng cách chạy cả hai mô hình trên chính tác vụ của bạn, và cửa sổ miễn phí trên LongCat-2.5-Preview khiến việc đó trở nên rẻ ngay lúc này. Một dấu vết suy luận xuất hiện trong trường reasoning_contentxen kẽ là chi tiết harness cần kiểm tra đầu tiên, bởi vì công cụ âm thầm loại bỏ nó sẽ đánh mất phần lớn tính hữu ích của mô hình mà không hề báo lỗi.

Điều này đặt việc so sánh ở đâu

Nếu bạn cần một quyết định ngay hôm nay và nó liên quan đến ngữ cảnh dài, GLM-5.2 là thứ bạn thực sự có thể đánh giá: nó có recall đã được công bố, điểm lập trình độc lập là 68.8 và Chỉ số Thông minh 33.7 từ Artificial Analysis, cùng mức giá bạn có thể lập ngân sách dựa trên đó. Những con số đó mô tả một mô hình có năng lực chứ không phải tiên phong — sản phẩm kế nhiệm của chính Z.ai, GLM-5.3, có điểm cao hơn nó — nhưng chúng mô tả được điều gì đó. LongCat-2.5-Preview là một đề xuất rẻ hơn, ngữ cảnh lớn hơn, hoàn toàn chưa được đo lường, mà phẩm chất hấp dẫn nhất của nó, giá cả, được nêu rõ là tạm thời. Thái độ đúng đắn đối với nó không phải là hoài nghi. Đó là một đánh giá kéo dài hai tuần với công cụ chấm điểm của riêng bạn được gắn vào, chạy trước khi mức giá khuyến mãi biến mất.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày