
GLM-5.2 là gì? Mô hình chủ lực mở trọng số với ngữ cảnh 1M của Z.ai, sau hai phiên bản
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
GLM-5.2 là một mô hình ngôn ngữ lớn chỉ xử lý văn bản, trọng số mở của Z.ai, phòng thí nghiệm tại Bắc Kinh trước đây được biết đến với tên Zhipu AI, phát hành ngày 16 tháng 6 năm 2026 theo giấy phép MIT. Đây là mô hình hỗn hợp chuyên gia (mixture-of-experts) 753 tỷ tham số với cửa sổ ngữ cảnh một triệu token, và trong khoảng hai tháng, nó là mô hình lập trình trọng số mở mạnh nhất mà bất kỳ ai cũng có thể tải về. Nó không còn giữ vị trí đó nữa, vì Z.ai kể từ đó đã tung ra hai phiên bản kế nhiệm dựa trên nó — đó là phần mà hầu hết các trang về GLM-5.2 bỏ qua, và cũng là phần quyết định liệu bạn có còn nên quan tâm hay không.
Bốn mươi ba bài viết trong kho lưu trữ của blog này có nhắc đến GLM-5.2. Cho đến nay, chưa một bài nào trong số đó thực sự nói về nó: mô hình này xuất hiện như đối thủ trong hết so sánh này đến so sánh khác, cái mốc tham chiếu cố định mà các mô hình mới hơn bị đem ra đo lường. Đó là một vai trò kỳ lạ đối với một mô hình mà chính nhà sản xuất của nó đã vượt qua, và đó là lý do trang này tồn tại — một mô tả thẳng thắn về GLM-5.2 thực sự là gì, nó tốn bao nhiêu, nó giỏi ở điểm nào, và ai vẫn nên chọn nó.
GLM-5.2 nằm ở đâu trong dòng sản phẩm của chính Z.ai
Z.ai công bố một nhật ký phát hành có ghi ngày tháng, và đây là nguồn rõ ràng nhất cho việc này. Đọc theo thứ tự và hình hài của cả dòng sản phẩm hiện ra rõ ràng:

• GLM-5 — 12 tháng 2 năm 2026. GLM-5 đầu tiên, hướng đến kỹ thuật hệ thống phức tạp và các tác vụ agent tầm xa.
• GLM-5.1 — 7 tháng 4 năm 2026. Công việc tầm dài hạn, có thể tự chạy đơn độc tới tám giờ trong một lần chạy.
• GLM-5.2 — 16 tháng 6 năm 2026. Mẫu flagship ngữ cảnh 1M cho các tác vụ tầm dài hạn; nhật ký của Z.ai mô tả nó là "ngữ cảnh 1M không mất mát, cải thiện đáng kể năng lực tác vụ tầm dài hạn".
• GLM-5.3 — 18 tháng 8 năm 2026. Cùng mô hình nền tảng như GLM-5.2, với mức cải thiện đến từ huấn luyện hậu kỳ. Z.ai báo cáo mức tăng 50% so với GLM-5.2 trên Code Bench nội bộ của mình và đạt trạng thái tiên tiến nhất mã nguồn mở trên Terminal Bench 3.0.
• GLM-5.3-Flash — 26 tháng 8 năm 2026. Một mô hình khác, nhỏ hơn, được xây dựng trên nền tảng mới được huấn luyện (tổng 320B, 18B hoạt động), là GLM-5 đầu tiên đa phương thức gốc.
Điểm quan trọng là mục GLM-5.3. GLM-5.3 không phải là một GLM-5.2 lớn hơn — nó là cùng các trọng số nền được đẩy xa hơn bằng hậu huấn luyện. Điều đó khiến GLM-5.2 trở thành mô hình cuối cùng trong dòng có năng lực đến từ kiến trúc, và khiến GLM-5.3 trở thành mô hình văn bản chủ lực hiện tại. Nếu hôm nay bạn chọn một mô hình Z.ai chỉ dựa trên chất lượng, GLM-5.3 là câu trả lời còn GLM-5.2 thì không.
GLM-5.3-Flash là một nhánh riêng biệt chứ không phải một GLM-5.3 rẻ hơn: một mô hình nhỏ hơn, đa phương thức nguyên bản (văn bản, hình ảnh và video) có giá thấp hơn một bậc độ lớn so với các mô hình chủ lực chuyên văn bản. Nếu bạn cần khả năng thị giác, GLM-5.2 không phải là mô hình bạn muốn trong cả hai trường hợp.
Bảng thông số kỹ thuật
• Tham số — tổng cộng 753B, theo thẻ mô hình tại zai-org/GLM-5.2-FP8. Z.ai không nêu số lượng tham số hoạt động trên thẻ đó; các danh mục của bên thứ ba đưa ra con số gần 40B mỗi token, và chúng tôi không thể xác nhận con số đó từ một nguồn sơ cấp.
• Cửa sổ ngữ cảnh — 1M token, được mô tả trên thẻ là "một ngữ cảnh 1M token vững chắc, duy trì ổn định các tác vụ dài hạn".
• Đầu ra tối đa — 128K token.
• Phương thức — văn bản vào, văn bản ra. Không có đầu vào hình ảnh, không có âm thanh. Mục trong danh mục của chính chúng tôi về mô hình này ghi rằng nó "chỉ hỗ trợ đầu vào văn bản".
• Giấy phép — MIT, không có giới hạn khu vực. Trọng số được công bố thông qua tổ chức zai-org trên Hugging Face với các biến thể BF16 và FP8.
• Kiểm soát suy luận — chế độ suy nghĩ kết hợp được điều khiển bởi tham số reasoning_effort với các cài đặt high và max, mặc định là max. Hỗ trợ gọi công cụ gốc và đầu ra có cấu trúc.
• Kiến trúc — IndexShare, tái sử dụng một bộ đánh chỉ mục nhẹ trên mỗi bốn lớp chú ý thưa và, theo thẻ mô hình, giúp giảm FLOPs mỗi token 2,9 lần ở ngữ cảnh đầy đủ; cùng với một lớp dự đoán đa token cải tiến giúp tăng độ dài chấp nhận giải mã suy đoán lên tới 20%.
• Phần cứng huấn luyện — các bài báo đưa tin về buổi ra mắt nêu rằng mô hình được huấn luyện trên các bộ tăng tốc Huawei Ascend, không dùng phần cứng Nvidia. Đó là tuyên bố từ bản tin, không phải từ thẻ mô hình, và chúng tôi truyền đạt lại đúng như vậy.

Những gì GLM-5.2 làm tốt một cách có thể đo lường được
Gần như mọi thứ mà GLM-5.2 làm tốt đều là một phép đo về lập trình hoặc agentic, và những con số dưới đây do nhà cung cấp báo cáo — chúng đến từ bảng benchmark trên thẻ mô hình của chính Z.ai, không phải từ một bản tái lập độc lập.
• Terminal Bench 2.1 (Terminus-2) — 81.0, so với 63.5 của GLM-5.1. Đó là bước nhảy vọt giữa các thế hệ lớn nhất trong bảng.
• SWE-bench Pro — 62.1, so với 58.4 của GLM-5.1.
• FrontierSWE (Dominance) — 74.4, so với 30.5 của GLM-5.1 và 72.6 của GPT-5.5.
• AIME 2026 — 99.2. GPQA-Diamond — 91.2. Cả hai đều có sức cạnh tranh thoải mái với nhóm mô hình tiên tiến đóng trên bảng của chính Z.ai.
• MCP-Atlas (public set) — 76.8, về cơ bản ngang bằng với 77.8 của Claude Opus 4.8 trên cùng bảng.
• Truy hồi ngữ cảnh dài — 78.3, đây là con số quan trọng nhất đối với cửa sổ 1M token. Cửa sổ chỉ hữu ích nếu khả năng truy hồi vẫn giữ được ở độ sâu, và con số của chính Z.ai cho thấy điều đó phần lớn là đúng.
Bức tranh độc lập thì mỏng hơn nhưng vẫn có thật. Artificial Analysis ghi nhận GLM-5.2 đạt điểm 34 trên Intelligence Index v4.3.2 của mình, xếp thứ 11 trong số 114 mô hình cùng lớp. Có hai lưu ý đi kèm với con số đó, và chính Artificial Analysis nêu rõ cả hai: mô hình bị đánh dấu là không còn được hỗ trợ (deprecated) trên trang của họ, và họ "chỉ tiếp tục đo hiệu năng cho khối lượng đầu vào mặc định 10k token" — kết quả cho các khối lượng khác chỉ mang tính lịch sử và không còn được cập nhật. Mục trong danh mục của chúng tôi cho mô hình này chứa một bản chụp đánh giá cũ hơn từ ngày 25 tháng 6 năm 2026 với điểm Intelligence là 33.7, đây không phải là cùng một bản sửa đổi chỉ số như con số hiện hành và không nên được hiểu là mô hình đã thay đổi.
Nó kém cỏi một cách có thể đo lường được ở những điểm nào
Ba điều, và chúng đáng để nói thẳng.
• Nó chỉ xử lý văn bản. Không có đầu vào hình ảnh, không có đầu vào âm thanh. GLM-5.3-Flash mới là mô hình đa phương thức trong dòng này, và nếu khối lượng công việc của bạn liên quan đến ảnh chụp màn hình, PDF hay video thì GLM-5.2 hoàn toàn không phải là nhánh đúng.
• Nó thua kém nặng nề ở những phép đo về tầm xa dài nhất và kỹ thuật phần mềm khó nhất. Trên SWE-Marathon, nó đạt 13,0 so với 26,0 của Claude Opus 4.8. Trên DeepSWE, nó đạt 46,2 so với 58 của Claude Opus 4.8 và 70 của GPT-5.5. Trên NL2Repo, nó đạt 48,9 so với 69,7 của Opus 4.8. Đây đều là những con số do nhà cung cấp công bố, lấy từ chính bảng mà ở đó GLM-5.2 giành chiến thắng ở những chỗ khác, và chính điều đó khiến chúng đáng tin: Z.ai đã công bố chúng ngay bên cạnh những chiến thắng của chính mình.
• Nó đã bị vượt qua ở những phép đo đã làm nên tên tuổi của nó. GLM-5.3 dùng cùng nền tảng và đánh bại nó trên Code Bench của chính Z.ai tới 50%, trên Terminal Bench 3.0 và trên Agents' Last Exam. GLM-5.2 cũng bị đánh dấu là không còn được khuyến nghị (deprecated) tại Artificial Analysis.
Một số liệu mà chúng tôi không thể có được: chúng tôi không thể xác nhận một phép đo thông lượng hoặc độ trễ độc lập hiện tại cho GLM-5.2 từ một nguồn mà chúng tôi có thể mở được, vì vậy trang này không nêu số liệu nào thay vì lặp lại một con số mà chúng tôi không thể kiểm chứng.
Giá và nơi chạy nó
Bảng giá của chính Z.ai, đọc hôm nay, liệt kê GLM-5.2 ở mức:
• Đầu vào — $1.40 mỗi triệu token
• Đầu vào được lưu trong bộ nhớ đệm — $0.26 mỗi triệu token
• Đầu ra — $4.40 mỗi triệu token
Lưu trữ đầu vào đã cache được ghi là miễn phí trong thời gian giới hạn. Lưu ý rằng GLM-5.3 có đúng ba mức giá giống hệt, nên mô hình mới hơn không đắt hơn trong danh sách của Z.ai — điều này loại bỏ lý do thông thường để tiếp tục dùng mô hình cũ hơn.
Về tính khả dụng: mô hình được phục vụ thông qua endpoint tương thích OpenAI của chính Z.ai tại api.z.ai/api/paas/v4/chat/completions, với các SDK chính thức cho Python và Java, và trọng số có thể tải xuống từ Hugging Face để tự lưu trữ theo giấy phép MIT. Ngoài ra, nó còn khả dụng thông qua một số nền tảng suy luận của bên thứ ba. Chúng tôi định tuyến nó: OrcaRouter mang GLM-5.2 trên trang mô hình của mình với mức giá của nhà cung cấp Z.ai, không cộng thêm phí, vì vậy mức $1.40 / $4.40 ở trên là số tiền bạn trả qua chúng tôi chứ không phải một bản sao đã bị đội giá. Cùng một khóa cũng truy cập được phần còn lại của danh mục, điều này quan trọng ở đây vì một lý do cụ thể — xem bên dưới.

Ai nên chọn GLM-5.2, và ai nên chọn thứ khác
Chọn GLM-5.2 nếu bạn tự vận hành (self-hosting) và yêu cầu đặt ra là cửa sổ 1M token chứ không phải điểm benchmark. Giấy phép MIT không kèm hạn chế theo khu vực, các trọng số FP8 được công bố cùng thiết kế attention IndexShare khiến nó thực sự là thứ khả thi để chạy ở ngữ cảnh dài, và chỉ số recall ở độ sâu chính là con số biện minh cho cửa sổ đó. Đây cũng là một lựa chọn hợp lý nếu bạn đã có một pipeline được tinh chỉnh sẵn cho hành vi reasoning_effort của nó, và chi phí xác thực lại prompt trên GLM-5.3 vượt quá lợi ích thu được.
Hãy chọn GLM-5.3 thay vào đó nếu bạn đang mua token thay vì mua trọng số và chất lượng là tiêu chí duy nhất. Đây vẫn là cùng một mô hình cơ sở, được hậu huấn luyện tốt hơn, với mức giá niêm yết giống hệt nhau. Không có lý lẽ nào về giá để chọn mô hình cũ hơn trên chính bảng giá của Z.ai.
Hãy chọn GLM-5.3-Flash thay vào đó nếu bạn cần khả năng thị giác, hoặc nếu bạn cần lựa chọn rẻ nhất mà vẫn đủ năng lực: nó xử lý văn bản, hình ảnh và video và có giá thấp hơn nhiều so với cả hai mô hình chủ lực về văn bản.
Hãy chọn hẳn một thứ gì đó khác nếu công việc của bạn thuộc phần khó nhất của kỹ thuật phần mềm tầm xa. Trên bảng công bố của chính Z.ai, Claude Opus 4.8 đánh bại GLM-5.2 ở SWE-Marathon, DeepSWE, NL2Repo, SWE-bench Pro, ProgramBench và Tool-Decathlon; GPT-5.5 đánh bại nó ở DeepSWE và ProgramBench. Những chiến thắng của GLM-5.2 là thật, nhưng chúng tập trung vào lập trình tác tử kiểu terminal và suy luận, không phải các tác vụ marathon. Nếu đánh giá của bạn giống một lượt chạy tác tử hai giờ trên một kho mã lớn và xa lạ, thì lợi thế giá của mô hình trọng số mở không thu hẹp được khoảng cách đó theo những con số này.
Tóm tắt thực tiễn
GLM-5.2 là một mô hình MoE chỉ xử lý văn bản, 753 tỷ tham số, được cấp phép theo MIT, ngữ cảnh 1M, ra mắt ngày 16 tháng 6 năm 2026 với mức giá 1,40 USD / 4,40 USD cho mỗi triệu token, cùng với Terminal Bench 2.1 do nhà cung cấp báo cáo đạt 81,0, SWE-bench Pro đạt 62,1 và Chỉ số Trí tuệ Artificial Analysis Intelligence Index độc lập đạt 34. Đây là mô hình chủ lực GLM cuối cùng có năng lực đến từ kiến trúc thay vì từ hậu huấn luyện, nó đã bị chính nhà sản xuất của mình thay thế hai lần, và nó bị đánh dấu là ngừng hỗ trợ trên chính chỉ số độc lập đã chấm điểm nó.
Không điều nào trong số đó khiến nó trở thành một mô hình tồi. Nó khiến nó trở thành một mô hình đã ngã ngũ: câu hỏi thú vị về GLM-5.2 vào tháng 9 năm 2026 không phải là liệu nó có tốt hay không, mà là liệu thứ cụ thể bạn cần — một mô hình lập trình có ngữ cảnh dài, có thể tự host, được cấp phép MIT — có đáng giá với bạn hơn ba điểm mà GLM-5.3 bổ sung thêm trên cùng bộ trọng số hay không. Với hầu hết người mua token, câu trả lời là không. Với bất kỳ ai tải trọng số về, thì vẫn là có.
Nếu bạn muốn tự mình kiểm chứng điều đó mà không phải đưa nó vào một luồng production, thì lớp định tuyến là cách ít tốn kém nhất để làm việc đó: hướng cùng một yêu cầu tới GLM-5.2 và GLM-5.3 qua một endpoint duy nhất, so sánh trên chính các prompt của bạn, và để cơ chế chuyển đổi dự phòng tự động xử lý trường hợp endpoint của mô hình cũ hơn chính là cái bị sập.
Call GLM-5.2 through OrcaRouter at the Z.ai provider rate, zero markup. https://www.orcarouter.ai/models/z-ai/glm-5.2 One API key reaches GLM-5.2, GLM-5.3 and 200+ other models, with automatic failover if an endpoint goes down.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
