Qwen 3.8 vs GLM-5.2: Quy mô thô so với Mô hình mở tinh gọn, đã kiểm định
Guides & Insights

Qwen 3.8 vs GLM-5.2: Quy mô thô so với Mô hình mở tinh gọn, đã kiểm định

Tác giả

jinhao song

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai trong số các mô hình Trung Quốc được nhắc đến nhiều nhất năm 2026 đều là hệ thống Mixture-of-Experts thưa, cả hai đều hứa hẹn trọng số mở, và cả hai đều rẻ hơn so với các mô hình tiên tiến phương Tây — nhưng chúng có thể khác biệt nhau về triết lý. Alibaba Qwen3.8-Max, được giới thiệu tại Hội nghị Trí tuệ Nhân tạo Thế giới ở Thượng Hải vào ngày 19 tháng 7 năm 2026, đặt cược vào quy mô tuyệt đối: khoảng 2.4 nghìn tỷ tham số và sự tỉ mỉ ám ảnh mà những người thử nghiệm sớm yêu thích. Zhipu GLM-5.2 đặt cược vào điều ngược lại — một thiết kế gọn nhẹ với 40 tỷ tham số hoạt động mà Artificial Analysis đã đánh giá, với kết quả agentic nổi bật và trọng số mà bạn có thể tải ngay hôm nay. Đây là hiệu quả so với kích thước thô, và hai mô hình tạo nên một cuộc cạnh tranh rõ ràng bất thường.

Phiên bản GLM-5.2 để lộ toàn bộ thế bài, trong khi Qwen 3.8 vẫn úp hầu hết quân bài. Một lưu ý dành cho các nhà phát triển: cách trung thực nhất để biết model nào phù hợp với stack của bạn là chạy thử cả hai trên chính prompt của mình. OrcaRouter cung cấp quyền truy cập vào hơn 200 model thông qua một endpoint tương thích với OpenAI, cho phép bạn so sánh Qwen 3.8 với GLM-5.2 trên cùng một tác vụ mà không cần tích hợp hai SDK riêng biệt.

TL;DR phán quyết. GLM-5.2 là lựa chọn agentic mã nguồn mở thực tế mà bạn có thể sử dụng ngay bây giờ. Theo Artificial Analysis, nó mang chỉ số Intelligence Index đã được kiểm toán là 51, một điểm mạnh mẽ Terminal-Bench 2.1 là 82.7, giá rẻ $0.95 / $3.00 giá cả, bối cảnh 1M, và — quan trọng là — các trọng số mở đã được phát hành trên chỉ 40B tham số hoạt động. Qwen 3.8 Max là cược lớn hơn: ~2.4T tổng tham số và chất lượng thực tế hàng đầu, nhưng nó che giấu số lượng tham số hoạt động của mình, có không có điểm chuẩn độc lập, là mô hình chậm nhất mà người thử nghiệm đã chạy, và các trọng số của nó vẫn 'sắp ra mắt.' GLM chứng minh hiệu quả hoạt động; Qwen yêu cầu bạn tin vào quy mô.

Những điểm chính rút ra

•  GLM-5.2 (Zhipu) là một 753B-total / 40B-active MoE với chỉ số AA Intelligence Index đã được kiểm toán là 51điểm Terminal-Bench 2.1 là 82.7 (nguồn: Artificial Analysis); Qwen 3.8 Max là một ~2.4T MoE preview có số lượng tham số hoạt động không được tiết lộ và có không có điểm số đã được kiểm toán.

•  Các trọng số của GLM-5.2 đang mở và có thể tải xuống hôm nay (phát hành tháng 6 năm 2026); Qwen 3.8 được hứa hẹn "sớm" nhưng chưa được phát hành (~1.2TB, 8+ H200 GPUs để tự lưu trữ).

• Giá ưu đãi cho GLM: $0.95 / $3.00 trên 1M token (AA blended ~$0.90). Bản xem trước của Qwen 3.8 được giảm giá mạnh (~90%) nhưng có không có giá API cho mỗi token được công bố và mức giảm giá chỉ là tạm thời.

• Về công việc agentic/terminal, của GLM-5.2 82.7 Terminal-Bench là một điểm mạnh cụ thể, được kiểm chứng; lợi thế của Qwen 3.8 là sự kỹ lưỡng và các one-shot sáng tạo — ấn tượng trong các bài kiểm tra thực tế, nhưng chưa được kiểm toán và chậm.

• Cả hai đều là các mô hình MoE có trọng số mở của Trung Quốc với tuyên bố ngữ cảnh 1M token; sự khác biệt thực sự là tinh gọn và đã được kiểm chứng (GLM) so với lớn và chưa được kiểm chứng (Qwen).

Các số liệu Qwen 3.8 là các tuyên bố của nhà cung cấp hoặc ấn tượng thực tế sớm, không được kiểm soát — không được kiểm toán độc lập. Các số liệu GLM-5.2 đến từ Artificial Analysis và có thể khác với báo cáo của Zhipu. Giá dùng thử của Qwen 3.8 là mức giảm giá tạm thời; hãy xác minh tỷ lệ trên mỗi token trước khi lập ngân sách. Lưu ý rằng Qwen có các rào cản nội dung phù hợp với CCP về các chủ đề nhạy cảm chính trị.

Thông số kỹ thuật và giá, đặt cạnh nhau

Đây là dữ liệu cứng, mỗi con số GLM-5.2 đều được ghi nguồn gốc.

•  Nhà sản xuất / trạng thái — Qwen 3.8 Max: Alibaba; bản xem trước (19 tháng 7, 2026); GLM-5.2: Zhipu; phát hành tháng 6 năm 2026

• Kiến trúc — Qwen 3.8 Max: tổng cộng ~2,4T, sparse MoE; GLM-5.2: tổng cộng 753B, sparse MoE (Artificial Analysis)

•  Tham số hoạt động — Qwen 3.8 Max: Alibaba không tiết lộ; GLM-5.2: 40B tham số hoạt động (Artificial Analysis)

•  Cửa sổ ngữ cảnh — Qwen 3.8 Max: Được báo cáo ~1M token (chưa được xác nhận chính thức); GLM-5.2: 1M token (Artificial Analysis)

•  Chỉ số Trí tuệ AA — Qwen 3.8 Max: Chưa có — chưa được chấm điểm; GLM-5.2: 51 (Artificial Analysis)

•  Terminal-Bench 2.1 — Qwen 3.8 Max: Không có số liệu công bố; GLM-5.2: 82.7 (Artificial Analysis)

• Giá (đầu vào / đầu ra) — Qwen 3.8 Max: Chỉ xem trước (giảm ~90%; API theo token chưa công bố); GLM-5.2: $0.95 / $3.00 trên 1M (AA blended ~$0.90)

• Trọng số mở — Qwen 3.8 Max: Đã hứa "sớm" (chưa phát hành); GLM-5.2: Có — đã phát hành, có thể tải xuống hôm nay

•  Tốc độ — Qwen 3.8 Max: Mô hình chậm nhất được thử nghiệm (thực hành); GLM-5.2: Lean 40B active — hiệu quả theo thiết kế

Hai yếu tố định hình cuộc so tài này. Đầu tiên, hàng 'tham số hoạt động' là nơi hai triết lý đối đầu. GLM-5.2 thực hiện công việc biên giới-tác nhân của nó — điểm 82.7 trên Terminal-Bench 2.1 là một số điểm nghiêm túc — chỉ với 40B tham số hoạt động, một con số công khai, có thể kiểm chứng. Qwen 3.8 có khoảng 2.4T tổng tham số nhưng sẽ không nói có bao nhiêu tham số hoạt động, vì vậy bạn hoàn toàn không thể đánh giá hiệu quả của nó. Một mô hình chứng minh nó hiệu quả; mô hình kia yêu cầu bạn giả định điều đó.

Thứ hai, mọi yếu tố quyết định sự chấp nhận thực tế hiện tại đều nghiêng về phía GLM. Nó có một chỉ số đã được kiểm toán (51) trong khi Qwen có một ô trống; nó có một mức giá công bố, ổn định ($0.95 / $3.00) trong khi Qwen có mức giảm giá tạm thời và không có giá API; và các trọng số của nó đã được đưa ra bàn còn của Qwen chỉ là lời hứa. Đối trọng của Qwen 3.8 là quy mô thô và sự kỹ lưỡng mà quy mô đó dường như mua được — một lợi thế thực sự trong các công việc ưu tiên chất lượng, nhưng chưa phải là một lợi thế mà bảng điểm trung lập đã xác nhận.

Hiệu suất so với quy mô thô

Trọng tâm của sự so sánh này là một câu hỏi mà lĩnh vực này cứ quay vòng: liệu công việc đẳng cấp tiên phong có cần tham số quy mô tiên phong? GLM-5.2 là lập luận mạnh mẽ gần đây nhất rằng không cần. Với 40B tính toán chủ động cho mỗi token, nó đạt 82,7 trên Terminal-Bench 2.1 — một trong những kết quả agentic/terminal tốt nhất hiện nay, theo Artificial Analysis — và đạt chỉ số tổng thể đã được kiểm toán là 51. Đó là một mô hình tinh gọn, tập trung, vượt xa trọng lượng tham số chủ động của nó, và nó là open-weight, vì vậy một nhóm có thể tải xuống, kiểm tra và chạy nó trên phần cứng ít hơn nhiều so với yêu cầu của một gã khổng lồ 2,4T.

Qwen 3.8 đi theo một hướng khác. Nó dựa vào kích thước thuần túy, và trong các bài kiểm tra thực tế, quy mô đó thể hiện ở sự tỉ mỉ thay vì tốc độ. Trong một bài đánh giá về khả năng hiểu kiến trúc, một người đánh giá (Trilogy AI) đã chạy Qwen 3.8 đối đầu với Kimi K3: Qwen đạt 80/100 so với 83 của Kimi, nhưng rõ ràng là toàn diện hơn — 354 trích dẫn kho lưu trữ so với 274, không có lệnh gọi công cụ nào thất bại so với hai lần của Kimi — với cái giá là độ trễ cao hơn và tổng số token nhiều hơn. Một người đánh giá khác (thomas-wiegold.com) gọi nó là "rất tốt và rất chậm", mô hình chậm nhất mà họ từng dùng, nhưng vẫn xếp nó vào nhóm năng lực hàng đầu. Đó chính là canh bạc của Qwen ở quy mô nhỏ: đào sâu hơn, trích dẫn nhiều hơn, bỏ sót ít hơn — nhưng phải trả giá bằng thời gian, token, và (hiện tại) những tuyên bố chưa thể kiểm chứng.

Đối với bất kỳ tác vụ agentic nào — các vòng lặp terminal, pipeline nặng về công cụ, triển khai tự lưu trữ — sự kết hợp của GLM-5.2 giữa điểm số 82.7 Terminal-Bench cụ thể, dấu chân hoạt động nhỏ và trọng số đã phát hành là khó có thể phản bác ngày hôm nay. Sự kỹ lưỡng của Qwen 3.8 thực sự có giá trị cho các nghiên cứu chuyên sâu, ưu tiên chất lượng và lập trình nơi bạn có thể chấp nhận độ trễ, nhưng bạn đang mua nó dựa trên niềm tin: không có điểm số đã được kiểm toán, tham số hoạt động ẩn, trọng số vẫn đang chờ xử lý và các rào chắn phù hợp với CCP về các chủ đề nhạy cảm. Hiệu quả bạn có thể đo lường được đánh bại quy mô bạn không thể.

Câu hỏi thường gặp

Liệu Qwen 3.8 có tốt hơn GLM-5.2 không?

Dựa trên bằng chứng hiện tại, GLM-5.2 là lựa chọn an toàn hơn. Nó có Chỉ số Trí tuệ Phân tích Nhân tạo (Artificial Analysis Intelligence Index) đã được kiểm toán đạt 51 và điểm Terminal-Bench 2.1 mạnh mẽ là 82,7, cùng với trọng số mở (open weights) bạn có thể chạy ngay. Qwen 3.8 có thể sánh ngang hoặc vượt trội hơn trong các tác vụ chuyên sâu, ưu tiên chất lượng — những người thử nghiệm sớm đánh giá cao độ kỹ lưỡng của nó — nhưng nó không có điểm số độc lập, che giấu số lượng tham số hoạt động và là mô hình chậm nhất trong các bài kiểm tra thực tế. Tiềm năng trên giấy tờ so với đã được chứng minh và sẵn có: GLM chiến thắng ở thì hiện tại.

Tôi có thể tải xuống và tự lưu trữ một trong hai cái không?

Trọng số của GLM-5.2 là mã nguồn mở và đã được phát hành (tháng 6 năm 2026), và với 40B tham số hoạt động, nó thực tế hơn nhiều để tự triển khai so với mô hình 2.4T. Trọng số mở của Qwen 3.8 được hứa hẹn "sớm" nhưng chưa ra mắt; ngay cả khi đã phát hành, một mô hình ~2.4T có kích thước khoảng 1.2TB ở độ chính xác 4-bit và cần 8+ GPU H200, điều này nằm ngoài tầm với của hầu hết các đội nhóm. Nếu việc tự triển khai quan trọng ngay hôm nay, GLM là lựa chọn thực tế duy nhất ở đây.

Cái nào rẻ hơn?

GLM-5.2 có mức giá rõ ràng, ổn định: $0.95 / $3.00 trên 1 triệu token, với tỷ lệ pha trộn Artificial Analysis khoảng $0.90. Bản xem trước của Qwen 3.8 được giảm giá mạnh (~90% giảm, có khi đến ~98% qua đêm) nhưng không có giá API cho mỗi token được công bố và ưu đãi giảm giá chỉ là tạm thời — vì vậy bạn có thể lập ngân sách một cách tự tin với GLM, nhưng chưa thể với Qwen.

Cái nào tốt hơn cho công việc tác nhân và terminal?

GLM-5.2, dựa trên bằng chứng hiện tại. Điểm 82.7 Terminal-Bench 2.1 (theo Artificial Analysis) là một kết quả tác nhân cụ thể, đã được thẩm định, và dấu chân hoạt động nhỏ cùng với trọng số đã phát hành giúp nó dễ dàng triển khai trong các vòng lặp nhiều công cụ. Qwen 3.8 thể hiện khả năng sử dụng công cụ mạnh mẽ trong các bài kiểm tra thực tế (không có lệnh gọi công cụ thất bại nào trong một bài đánh giá) nhưng không có điểm số tác nhân được kiểm toán tương đương.

Tôi nên dùng cái nào hôm nay?

GLM-5.2 dành cho các pipeline tác nhân, tự lưu trữ, sản xuất nhạy cảm chi phí và bất cứ thứ gì bạn cần một mô hình đã được chứng minh, có thể tải xuống ngay lúc này. Qwen 3.8 dành cho nghiên cứu chuyên sâu, ưu tiên chất lượng hoặc lập trình nơi sự kỹ lưỡng của nó mang lại hiệu quả và bạn có thể chịu được các lần chạy chậm — và để giữ một lựa chọn mở cho khi các trọng số và điểm số độc lập đầu tiên của nó xuất hiện.

Kết luận

Qwen 3.8 so với GLM-5.2là sự so sánh giữa hiệu quả và quy mô thô, và hiện tại hiệu quả đang thắng về điểm số. GLM-5.2 cho thấy toàn bộ bài của mình — 40B tham số hoạt động làm công việc tiên phong về tác nhân, chỉ số đã được kiểm toán là 51, Terminal-Bench 82.7, giá cả rẻ và ổn định, và trọng số mở mà bạn có thể tải về ngay hôm nay. Qwen 3.8 dựa vào kích thước khổng lồ 2.4T và sự kỹ lưỡng mà người thử nghiệm thực sự ngưỡng mộ, nhưng nó giấu số tham số hoạt động, không có điểm số độc lập, giao hàng chậm hơn bất kỳ thứ gì người đánh giá đã từng sử dụng, và trọng số của nó vẫn chỉ là một lời hứa. GLM-5.2 là lựa chọn thực dụng về trọng số mở cho tác nhân hiện có; Qwen 3.8 là canh bạc lớn hơn vẫn cần trọng số và một điểm số thực sự để chứng minh giá trị. Hãy theo dõi cả hai — cho đến khi chúng xuất hiện, hãy chạy song song hai mô hình trên các prompt của bạn và để kết quả, chứ không phải số tham số, quyết định.


© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

Liên hệ với chúng tôi

Tham gia cộng đồng

DiscordEmailXGitHubYouTube