Thẻ tiêu đề chính cho phần so sánh GLM-5.3 và GLM-5.2, có phụ đề 'Cùng bộ não, điểm chuẩn tăng gấp đôi', với hai thẻ mô hình dùng chung một khối nền MoE 743B được kết nối duy nhất và một mũi tên nâng cấp cong được gắn nhãn 'chỉ hậu huấn luyện' trỏ từ GLM-5.2 đến GLM-5.3.
Guides & Insights

GLM-5.3 vs GLM-5.2: Cùng bộ não, Điểm chuẩn tăng gấp đôi

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Cách diễn giải của chính Zhipu AI cho việc nâng cấp từ GLM-5.2 lên G​LM-5.3 là cách trung thực: sách giáo khoa không thay đổi, chỉ có sự rèn luyện của học sinh là thay đổi. G​LM-5.3, phát hành ngày 14 tháng 8 năm 2026, được xây dựng trên cùng một nền tảng MoE 743 tỷ tham số với GLM-5.2, vốn đã lên ngôi trong lĩnh vực trọng số mở trên Chỉ số Trí tuệ Phân tích Nhân tạo vào tháng 6. Kiến trúc không thay đổi, mức tiêu thụ tài nguyên (footprint) không thay đổi, mức giá 1,40 USD / 4,40 USD cho mỗi triệu token không thay đổi — vậy mà Z.ai báo cáo rằng mô hình được huấn luyện lại này gấp đôi hoặc hơn người tiền nhiệm trên một số điểm chuẩn về mã nguồn và bảo mật mà cả hai phiên bản đều công bố. Liệu điều đó có khiến G​LM-5.3 trở thành bản nâng cấp bắt buộc hay một sự chờ đợi phụ thuộc vào mức độ bạn tin tưởng một mô hình đã cải thiện nhiều đến vậy mà không thay đổi kiến trúc của chính nó, và liệu năng lực mạng mới xuất hiện của nó có phải là một tính năng bạn muốn bị chặn lại sau một khoảng thời gian an toàn hai tuần hay không.

Cùng một bộ não, được tái đào tạo

Mọi thứ từng tạo nên GLM-5.2 như một máy chủ thực dụng đều được kế thừa: mô hình MoE 743B với khoảng 40B tham số hoạt động, cơ chế chú ý thưa IndexShare đã cắt giảm FLOPs ở ngữ cảnh 1M, giấy phép MIT, cửa sổ ngữ cảnh 1M, và thông lượng token gọn nhẹ đo được khoảng 145–168 token/giây trong quan sát độc lập. G​LM-5.3 chỉ khác ở một khía cạnh duy nhất — giai đoạn hậu huấn luyện. Z.ai đã mở rộng giai đoạn học tăng cường với các khung IndexShare, SAO và Slime, bổ sung nhiều gấp hàng chục lần môi trường tác vụ tầm xa, đồng thời mở rộng chúng từ gỡ lỗi mã nguồn sang phát hiện lỗ hổng bảo mật và kỹ thuật hệ thống. Kết quả là một mô hình hoạt động khác đi trên cùng phần cứng, và đó chính xác là lý do câu hỏi nâng cấp không phải là "tôi có cần GPU mới không" mà là "tôi có cần hành vi mới không."

Chênh lệch chuẩn, theo cả hai hướng

Nếu xem như một phép so sánh trước-sau trên các số liệu đã công bố của Z.ai, cú nhảy vọt này là lớn nhất trong lịch sử các mô hình open-weight. Terminal-Bench 3.0 — phiên bản sửa đổi khó hơn, nơi cả hai mô hình đều được chấm điểm — tăng từ 4.6 lên 28.3, một bước nhảy gấp sáu lần. DeepSWE v1.1 tăng từ 46.2 lên 66.9, đó chính là sự khác biệt giữa "một mô hình mở tốt" và "khả năng cạnh tranh với các mô hình đóng dẫn đầu." Tập con CLI của The Agents' Last Exam tăng từ 23.8 lên 28.5. Khả năng phát hiện lỗ hổng của CyberGym tăng từ 77.2 lên 84.5. ExploitBench tăng hơn gấp đôi, từ 24.4 lên 54.4, và thông lượng của ExploitGym tăng từ 29 và 39 tác vụ hoàn thành (trong hai và sáu giờ) lên 105 và 130. Z.ai tóm tắt rằng đây là mức cải thiện khoảng 50% về khả năng lập trình, và cấu trúc của các mức tăng — tập trung vào lập trình tầm xa, tự động hóa terminal và bảo mật — nhất quán với một mô hình chỉ được post-training: kiến thức thô là không đổi, nhưng khả năng thực sự thực hiện các công việc đa bước mới chính là thứ đã trở nên mạnh hơn.

• Terminal-Bench 3.0 — GLM-5.2 4.6 so với GLM-5.3 28.3

• DeepSWE v1.1 — GLM-5.2 46.2 so với G​LM-5.3 66.9

• Agents' Last Exam (CLI) — GLM-5.2 23.8 so với GLM-5.3 28.5

• Phát hiện lỗ hổng CyberGym — GLM-5.2 77.2 so với G​LM-5.3 84.5

• ExploitBench — GLM-5.2 24.4 so với G​LM-5.3 54.4

The OrcaRouter GLM-5.2 model page showing Z.ai's open-weights flagship with its per-million-token pricing, context window and model ID.Scoreboard contrasting GLM-5.2 (Terminal-Bench 3.0 4.6, DeepSWE v1.1 46.2, Agents' Last Exam CLI 23.8, CyberGym 77.2, ExploitBench 24.4, Price $1.40/$4.40 per M) with GLM-5.3 (Terminal-Bench 3.0 28.3, DeepSWE v1.1 66.9, Agents' Last Exam CLI 28.5, CyberGym 84.5, ExploitBench 54.4, Price $1.40/$4.40 per M).

Khả năng không ai lên lịch

Lợi ích về bảo mật xứng đáng có một đoạn riêng, vì Z.ai cho biết đó không nằm trong kế hoạch. Nhóm hậu huấn luyện đã thêm các môi trường phát hiện lỗ hổng với kỳ vọng cải thiện ở mức khiêm tốn; thay vào đó, mô hình bắt đầu móc nối các exploit hoàn chỉnh thành chuỗi — một hành vi mới nổi buộc Z.ai phải giữ lại trọng số khoảng hai tuần để gia cố an toàn. Trong thử nghiệm thực tế với các đội ngũ bảo mật, G​LM-5.3 đã góp phần tìm ra 2.436 lỗ hổng trên 269 dự án, trong đó 1.097 lỗ hổng có rủi ro trung bình hoặc cao, bao gồm cả những lỗi đã tồn tại mà không bị phát hiện suốt nhiều thập kỷ trong các phần mềm được triển khai rộng rãi. GLM-5.2 có năng lực bảo mật theo nghĩa thông thường — nó có thể đọc mã nguồn để tìm lỗi. G​LM-5.3 có năng lực đó theo một nghĩa khác: nó chính là thứ mà khoảng thời gian an toàn đó hướng tới. Đó là sự thay đổi về bản chất, không phải về mức độ, và là lý do mạnh mẽ nhất để coi hai mô hình là hai sản phẩm khác nhau dù có chung nền tảng.

Infographic titled 'The upgrade delta' showing a two-column before-and-after comparison of GLM-5.2 vs GLM-5.3 across five benchmarks with upward arrows: Terminal-Bench 3.0 4.6 to 28.3, DeepSWE v1.1 46.2 to 66.9, Agents' Last Exam CLI 23.8 to 28.5, CyberGym 77.2 to 84.5, ExploitBench 24.4 to 54.4.

Lưu ý về tính nhất quán

Đối trọng với mọi con số nêu trên là các thử nghiệm độc lập ban đầu mô tả G​LM-5.3 có tính không nhất quán mà GLM-5.2 không có. Các nhà đánh giá độc lập cho biết chính mô hình này có lúc hoạt động như một kỹ sư thuê ngoài chỉ vừa đủ đạt yêu cầu ở một số tác vụ, lại có lúc cho ra kết quả đạt chuẩn chuyên nghiệp ở những tác vụ khác, với sự khác biệt bám sát độ rõ ràng của yêu cầu được đưa ra. Đó chính xác là kiểu thất bại mà bạn có thể dự đoán ở một mô hình có toàn bộ mức cải thiện đến từ quá trình hậu huấn luyện dựa nhiều vào môi trường: nó khái quát hóa từ các dạng tác vụ đã được huấn luyện, còn những lời nhắc được nêu yêu cầu kém rõ ràng sẽ nằm ngoài phạm vi đó. Không một kết quả độc lập nào sạch đẹp như các bảng số mà Z.ai công bố, và cũng chưa con số nào của Z.ai được tái tạo một cách độc lập. Trong bối cảnh sản xuất, điều đó cho thấy cần đánh giá một cách tường minh trên chính khối lượng công việc của bạn trước khi chuyển đổi — cùng lời cảnh báo đã từng được đặt ra với GLM-5.2, nhưng lần này với khoảng chênh lệch rộng hơn giữa trường hợp tốt nhất và xấu nhất.

Giá cả, khả năng tiếp cận và câu hỏi về sự chờ đợi

Giá của cả hai model là giống hệt nhau, điều này loại bỏ rào cản nâng cấp thông thường: cả hai đều có giá $1.40 / $4.40 mỗi triệu token, với G​LM-5.3 yêu cầu bật chế độ tư duy. Sự khác biệt thực sự nằm ở khả năng truy cập. GLM-5.2 có thể tải xuống ngay hôm nay theo giấy phép MIT, tự lưu trữ với dung lượng FP8 dưới một terabyte và có thể gọi qua OrcaRouter với giá niêm yết, không phụ phí — model bạn có thể định tuyến đến ngay lúc này, ổn định và được chấm điểm độc lập. G​LM-5.3 hiện có thể sử dụng qua ZCode / AutoClaw của Z.ai và G​LM Coding Plan, nhưng cả API công khai lẫn bộ trọng số đều bị giới hạn trong giai đoạn an toàn, và các số liệu benchmark của nó đều do nhà cung cấp công bố, đang chờ bên thứ ba chạy lại xác minh. Vậy nên câu trả lời thẳng thắn cho câu hỏi "có nên chờ không" có hai phần: đối với lưu lượng production không được phép suy giảm, GLM-5.2 vẫn là lựa chọn an toàn với trọng số mở vào lúc này; và ngay khi API của G​LM-5.3 được mở cùng các lần chạy độc lập xác nhận, việc chuyển đổi chỉ là đổi tuyến, không phải viết lại — bạn giữ nguyên thiết lập một khóa và đổi làn. Đối với công việc khám phá và đánh giá bảo mật, G​LM-5.3 đáng để thử ngay bây giờ qua các công cụ của Z.ai, hiểu rằng lợi thế được công bố của nó chưa được xác minh và hành vi của nó biến động nhiều hơn so với model mà nó thay thế.

Phán quyết trung thực

G​LM-5.3 là mô hình tốt hơn theo số liệu của chính Z.ai — tốt hơn đáng kể về lập trình dài hạn và khác biệt hoàn toàn về bảo mật — và nó miễn phí cho quy trình làm việc của bạn vì nền tảng, mức tiêu thụ tài nguyên và giá cả không thay đổi. Nhưng "tốt hơn trên đánh giá của nhà cung cấp" và "tốt hơn trong quy trình của bạn" bị ngăn cách bởi hai thứ mà GLM-5.2 đã có và G​LM-5.3 chưa có: khả năng tái lập độc lập và trọng số phát hành. Nếu bạn đã chạy GLM-5.2, lộ trình nâng cấp là rẻ nhất trong lịch sử trọng số mở — cùng phần cứng, cùng giá, cùng bề mặt API, và chỉ cần đợi hai tuần để có trọng số. Quyết định ít liên quan đến việc G​LM-5.3 có tốt hơn GLM-5.2 hay không, mà liên quan nhiều hơn đến việc bạn có sẵn sàng đặt cược môi trường sản xuất vào một mô hình mà những cải tiến và khả năng bảo mật mới xuất hiện của nó vẫn chưa được bất kỳ ai bên ngoài Z.ai xác nhận.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

Liên hệ với chúng tôi

Tham gia cộng đồng

DiscordEmailXGitHubYouTube