
LongCat-2.5-Preview vs GLM-5.2: Hai cửa sổ 1M token, một trong số đó đã được đo lường
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 610 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 189 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
LongCat-2.5-Preview và GLM-5.2 cùng mang một con số đáng chú ý giống hệt nhau: cửa sổ ngữ cảnh một triệu token. Sự trùng hợp duy nhất ấy đang gánh vác toàn bộ công việc trong hầu hết các so sánh được viết ra trong tuần này, và chỉ riêng nó thì không đủ để so sánh hai mô hình. GLM-5.2 đã được ghi nhận công khai từ ngày 16 tháng 6 năm 2026 với hồ sơ benchmark công khai, bảng giá dịch vụ đã công bố và điểm số ghi nhớ ngữ cảnh dài từ một đơn vị đánh giá độc lập. LongCat-2.5-Preview xuất hiện trên LongCat API Platform của Meituan vào ngày 25 tháng 9 năm 2026 với bảng giá ưu đãi, số lượng tham số do báo chí ngành Trung Quốc đưa tin, và không có bất kỳ benchmark nào được công bố. Một cửa sổ được đo lường. Cái còn lại chỉ được khẳng định. Toàn bộ phần dưới đây giữ tách biệt hai hạng mục đó, bởi vì bảng thông số kỹ thuật và kết quả kiểm thử không phải là cùng một loại dữ kiện.
Đây là phiên bản trung thực của cuộc so tài, và nó hữu ích hơn phiên bản tâng bốc kia.
Những gì mỗi bên thực sự đã công bố
Nhật ký thay đổi của Meituan có một mục ghi ngày — “Phiên bản: 2026-09-25, LongCat-2.5-Preview hiện đã có” — liệt kê ba khả năng được tuyên bố: hiểu hình ảnh, lập trình và tương thích với “Claude Code và các môi trường phát triển phổ biến khác”, nêu tên Hermes, OpenClaw, OpenCode và Kilo Code. Trang định giá của nhà cung cấp nêu mức phí trả theo mức sử dụng là 0,30 đô la cho mỗi triệu token đầu vào chưa lưu đệm, 0,006 đô la cho mỗi triệu token đầu vào đã lưu đệm và 1,20 đô la cho mỗi triệu token đầu ra, được đánh dấu ngay trên chính trang đó là ưu đãi giảm giá có thời hạn. Cửa sổ ngữ cảnh là một triệu token và đầu ra tối đa là 131.072. Khoảng 1,6 nghìn tỷ tham số tổng cộng với khoảng 48 tỷ tham số hoạt động trên mỗi token, trên nền tảng mixture-of-experts, đến từ siêu dữ liệu trên chính trang web của Meituan và từ các bài viết công nghệ Trung Quốc về bản niêm yết này — không phải từ tài liệu API. Không có báo cáo kỹ thuật, không có thẻ mô hình và không có bảng đánh giá chuẩn nào đi kèm với bất kỳ nội dung nào trong số đó. Không có kho lưu trữ LongCat-2.5-Preview trên HuggingFace và không có kho lưu trữ nào cùng tên trong tổ chức GitHub của Meituan; siêu dữ liệu danh mục mô hình đi kèm với OpenCode ghi trọng số mở là false.

Z.ai's GLM-5.2 nằm ở vị trí ngược lại. Đây là bản phát hành tháng Sáu với bảng giá mà chúng tôi cung cấp theo giá niêm yết: 1,40 USD cho mỗi triệu token đầu vào, 0,26 USD cho mỗi triệu token đầu vào được lưu đệm và 4,40 USD cho mỗi triệu token đầu ra trên danh mục của chúng tôi, với cửa sổ ngữ cảnh 1.000.000 token và đầu ra tối đa 128.000 token. Các điểm số đã công bố của nó đến từ hai nơi khác nhau, và sự phân biệt này rất quan trọng: các con số của chính Z.ai cho AIME 2026, HMMT February 2026, GPQA-Diamond và bộ FrontierSWE là do nhà cung cấp báo cáo; các chỉ số Coding Index và Intelligence Index mà danh mục của chúng tôi hiển thị được lấy từ Artificial Analysis, đơn vị tự thực hiện các đánh giá của mình.
Phương diện duy nhất mà họ thực sự bình đẳng
Cả hai mô hình đều tuyên bố chính xác 1.000.000 token ngữ cảnh. Chỉ một trong số đó có điểm số được công bố để kiểm tra liệu một mô hình còn có thể sử dụng những gì nằm trong đó hay không. Artificial Analysis ghi nhận chỉ số Long-Context Recall là 78,33 cho GLM-5.2. LongCat-2.5-Preview không có con số tương đương, từ bất kỳ ai. Sự bất đối xứng đó chính là toàn bộ cuộc so tài gói trong một dòng: cửa sổ một triệu token là một tuyên bố về năng lực của kiến trúc, chứ không phải về việc mô hình có truy xuất đúng ở token 900.000 hay không. Năng lực thì rẻ để in ra và đắt để xác minh, đó là lý do mọi nhà cung cấp đều in nó ra và gần như không ai trong số họ công bố bài kiểm tra truy hồi.
Vậy nếu công việc ngữ cảnh dài là lý do bạn đang cân nhắc giữa hai lựa chọn này, thì bạn đang chọn giữa một lựa chọn có điểm recall đã công bố và một lựa chọn không có — và lựa chọn không có đó cũng chính là lựa chọn có hồ sơ benchmark chưa được đo lường. Đó không phải là lập luận chống lại nó. Đó là lập luận chống lại việc coi hai cái đó là hoán đổi được cho nhau chỉ dựa trên một số nguyên trùng khớp.

Chênh lệch giá trông như thế nào trong một công việc thực tế
Bảng giá không hề gần nhau, và hướng đi không phải là điều người ta mong đợi từ một đối thủ Trung Quốc theo trọng số mở chống lại một phòng thí nghiệm tiên phong phương Tây. LongCat-2.5-Preview rẻ hơn khoảng 4,7 lần ở đầu vào chưa được lưu đệm và rẻ hơn 3,7 lần ở đầu ra so với GLM-5.2 — một tỷ lệ chỉ là phép tính số học trên hai bảng giá đã công bố, không phải một phép đo. Trong một lượt xử lý tài liệu 500.000 token mà ghi trả lại 20.000 token, con số đó là khoảng 17 xu so với khoảng 79 xu. Cả hai mô hình đều phải đọc cùng một tài liệu. Chỉ một trong số chúng có điểm số được công bố về việc liệu nó có còn chú ý đến cuối tài liệu hay không.
Có một lưu ý thứ hai cần nói cùng lúc: Meituan tự gắn nhãn bảng giá của mình là ưu đãi có thời hạn. Con số $0.30 là con số khuyến mãi, và nhà cung cấp không nói điều gì sẽ đến sau đó. Một mô hình chi phí được xây dựng trên giá khuyến mãi có một ngày hết hạn mà bạn không thể đọc được. Đó là lý do để giữ chi phí chuyển đổi giữa các nhà cung cấp ở mức thấp, chứ không phải lý do để tránh mô hình.
Trên OrcaRouter, các route mà chúng tôi cung cấp nằm sau một key duy nhất với giá niêm yết của nhà cung cấp cùng mức phụ phí bằng không, nên khi nhà cung cấp thay đổi giá, hóa đơn của bạn được cập nhật ngay trong ngày thay vì phải đợi đến kỳ gia hạn tiếp theo, và cơ chế chuyển đổi dự phòng tự động sẽ đưa một yêu cầu bị suy giảm sang một nhà cung cấp khỏe mạnh mà ứng dụng của bạn không hề hay biết. GLM-5.2 là một trong các route của chúng tôi. LongCat-2.5-Preview thì không — chúng tôi không cung cấp mô hình đó, và không có nội dung nào ở đây nên được hiểu là khẳng định điều ngược lại. Z.ai cũng đã tiến xa kể từ tháng 6: GLM-5.3 đã có trên danh mục của chúng tôi kể từ ngày 18 tháng 8 năm 2026, nên một so sánh được đặt trong khuôn khổ "mô hình mới so với mô hình hiện tại" vốn đã định vị GLM-5.2 là mô hình đương nhiệm thay vì mô hình tiên phong.

Điều gì sẽ giải quyết được việc này, và điều gì sẽ không.
• Điểm Recall Ngữ cảnh Dài cho LongCat-2.5-Preview, từ Meituan hoặc từ một đơn vị đánh giá độc lập. Cho đến khi có được điều đó, cửa sổ 1M của nó chỉ là một tuyên bố không có bài kiểm tra đi kèm, và 78.33 của GLM-5.2 là con số duy nhất trong so sánh nói lên cùng một câu hỏi.
• Bảng giá của nhà cung cấp không có dấu hiệu thời gian có hạn. Mức giá đã giảm cho bạn biết mô hình có giá bao nhiêu trong đợt khuyến mãi, chứ không phải giá thực tế của nó.
• Một bảng benchmark dưới bất kỳ hình thức nào. Không phải vị trí trên bảng xếp hạng — chỉ là một lần chạy đánh giá đã được công bố, để việc so sánh không còn là chuyện bảng thông số kỹ thuật đối chiếu với một trang kết quả.
• Xác nhận về đầu vào hình ảnh. Nhật ký thay đổi giới thiệu khả năng hiểu hình ảnh như một bổ sung nổi bật, nhưng phản hồi ví dụ trong tài liệu "Retrieve Model" của chính Meituan vẫn hiển thị input_modalities là ["text"] với một text->text chuỗi modality. Mẫu đó có thể chỉ đơn giản là đã lỗi thời. Tuy vậy, đây vẫn là hợp đồng đã công bố của nhà cung cấp, nên hãy coi đầu vào hình ảnh là một tuyên bố chứ không phải là tính năng có sẵn. Ngược lại, GLM-5.2 là văn bản vào và văn bản ra trong danh mục của chúng tôi, hoàn toàn không có modality hình ảnh — vì vậy ở khía cạnh này, cả hai mô hình đều không cho bạn câu trả lời đã được xác minh, và một trong số chúng chỉ cho bạn một tuyên bố.
• Số liệu của chính bạn. Khoảng cách giữa những gì được công bố và những gì bạn cần sẽ được thu hẹp bằng cách chạy cả hai mô hình trên chính tác vụ của bạn, và cửa sổ miễn phí trên LongCat-2.5-Preview khiến việc đó trở nên rẻ ngay lúc này. Một dấu vết suy luận xuất hiện trong trường reasoning_contentxen kẽ là chi tiết harness cần kiểm tra đầu tiên, bởi vì công cụ âm thầm loại bỏ nó sẽ đánh mất phần lớn tính hữu ích của mô hình mà không hề báo lỗi.
Điều này đặt việc so sánh ở đâu
Nếu bạn cần một quyết định ngay hôm nay và nó liên quan đến ngữ cảnh dài, GLM-5.2 là thứ bạn thực sự có thể đánh giá: nó có recall đã được công bố, điểm lập trình độc lập là 68.8 và Chỉ số Thông minh 33.7 từ Artificial Analysis, cùng mức giá bạn có thể lập ngân sách dựa trên đó. Những con số đó mô tả một mô hình có năng lực chứ không phải tiên phong — sản phẩm kế nhiệm của chính Z.ai, GLM-5.3, có điểm cao hơn nó — nhưng chúng mô tả được điều gì đó. LongCat-2.5-Preview là một đề xuất rẻ hơn, ngữ cảnh lớn hơn, hoàn toàn chưa được đo lường, mà phẩm chất hấp dẫn nhất của nó, giá cả, được nêu rõ là tạm thời. Thái độ đúng đắn đối với nó không phải là hoài nghi. Đó là một đánh giá kéo dài hai tuần với công cụ chấm điểm của riêng bạn được gắn vào, chạy trước khi mức giá khuyến mãi biến mất.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
