
Qwen 3.8 so với GLM-5.2: Điểm chuẩn đầu tiên mà chúng thực sự trùng khớp
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
Hai mô hình này là biểu hiện rõ ràng nhất của những canh bạc đối lập trong lĩnh vực AI mã nguồn mở Trung Quốc. Mô hình của Zhipu, GLM-5.2, gọn nhẹ và đã được kiểm chứng: tổng cộng 753B tham số nhưng chỉ có 40B kích hoạt, chỉ số Artificial Analysis Intelligence Index được kiểm toán là 51, trọng số có thể tải xuống kể từ tháng 6/2026, và giá công bố là $0.95 / $3.00. Mô hình của Alibaba, Qwen3.8-Max, là canh bạc tối đa: ~2.4T tham số, số lượng kích hoạt không được tiết lộ, và — cho đến gần đây — không có con số nào cả.
Việc phát hành rộng rãi vào ngày 3 tháng 8 năm 2026 đã mang lại cho cuộc so kè này điều mà không bài viết nào khác trong loạt bài này có: một chuẩn đánh giá mà cả hai mô hình đều có điểm số. Alibaba báo cáo Terminal-Bench 2.1 ở mức 86.6; Artificial Analysis có GLM-5.2 được kiểm toán ở mức 82.7 trong cùng bài kiểm tra đó. Lần đầu tiên, tuyên bố của Qwen có thể được đặt cạnh một con số của đối thủ được đo lường độc lập trên cùng một nền tảng — với lưu ý quan trọng rằng chỉ một trong hai con số được tạo ra bởi trọng tài.
Lưu ý cho các nhà phát triển — cách nhanh nhất để giải quyết việc này là chạy cả hai trên prompt của riêng bạn. OrcaRouter cung cấp hơn 200 mô hình đằng sau một endpoint tương thích OpenAI, vì vậy bạn có thể so sánh Qwen 3.8 Max với GLM-5.2 trên cùng một tác vụ mà không cần tích hợp hai SDK.
Kết luận ngắn gọn. Trên benchmark dùng chung duy nhất, Qwen tuyên bố dẫn trước 3,9 điểm trên Terminal-Bench 2.1 (86,6 so với 82,7) — một kết quả thực nếu lặp lại được, dù số liệu của Qwen là tự báo cáo còn của GLM đã được kiểm toán. Ở mọi nơi khác, GLM-5.2 giữ lợi thế thực tế: nó rẻ hơn khoảng 2× ở mức $0,95 / $3,00 so với $2 / $6 của Qwen, trọng số của nó có thể tải xuống ngay hôm nay, 40B tham số hoạt động khiến nó thực sự có thể triển khai, và nó mang chỉ số độc lập 51 trong khi Qwen không có. Qwen đáp lại bằng ngữ cảnh phẳng 1M token, đa phương thức bản địa mà GLM thiếu, và trần tiềm năng cao hơn. Gọn nhẹ và đã được kiểm chứng vẫn đánh bại to lớn và chưa kiểm chứng trong sản xuất — nhưng khoảng cách đã thu hẹp vào ngày 3 tháng 8.
Những điểm chính cần ghi nhớ
• Sự trùng lặp trực tiếp đầu tiên về điểm chuẩn trong loạt bài: Terminal-Bench 2.1 — Qwen3.8-Max 86.6 (do Alibaba công bố) so với GLM-5.2 82.7 (Artificial Analysis, đã kiểm toán). Qwen dẫn trước 3.9 điểm, nhưng hai con số này không đáng tin cậy như nhau.
• GLM-5.2 có giá khoảng bằng một nửa: $0.95 / $3.00 mỗi 1M (AA blended ~$0.90) so với Qwen3.8-Max là $2 / $6.
• Tham số hoạt động mới là câu chuyện kiến trúc thực sự: GLM-5.2 chạy 40B hoạt động trong tổng số 753B. Alibaba vẫn chưa tiết lộ số tham số hoạt động của Qwen, điều này khiến chi phí vận hành của nó không thể mô hình hóa.
• Trọng số của GLM có thể tải về ngay hôm nay; còn trọng số của Qwen được hứa hẹn sẽ có trong tuần này, nhưng chưa có giấy phép hay kho lưu trữ nào.
• GLM-5.2 có chỉ số kiểm toán là 51. Qwen3.8-Max vẫn chưa được chấm điểm — mặc dù phiên bản tiền nhiệm Qwen3.7-Max đạt 46, thấp hơn GLM.
• Điểm độc đáo của Qwen: cửa sổ 1M token được tính phí cố định, không tính phụ phí cho prompt dài, cùng với hỗ trợ trực tiếp đầu vào văn bản/hình ảnh/video và đạt 92.1 trên OmniDocBench 1.5. GLM-5.2 chỉ tập trung vào văn bản.
Ghi chú về độ chính xác: mọi số liệu chất lượng của Qwen3.8-Max đều do Alibaba công bố và chưa được bên thứ ba xác minh. Số liệu của GLM-5.2 lấy từ Artificial Analysis. Việc so sánh điểm số tự công bố với điểm số đã được kiểm toán trên cùng một benchmark mang tính tham khảo nhưng không phải là kết luận cuối cùng — bộ thử nghiệm của nhà cung cấp và bộ thử nghiệm đánh giá khác nhau. Giá của Qwen theo biểu giá GA và thay thế mức chiết khấu dành cho bản xem trước hồi tháng 7.
Thông số kỹ thuật và giá, cạnh nhau
Đây là dữ liệu cứng, mỗi con số đều được ghi rõ nguồn gốc.
• Nhà sản xuất / trạng thái — Qwen3.8-Max: Alibaba; GA (3 tháng 8 năm 2026); GLM-5.2: Zhipu; phát hành tháng 6 năm 2026
• Kiến trúc — Qwen3.8-Max: ~2.4T tổng, MoE thưa; GLM-5.2: 753B tổng, MoE thưa (Artificial Analysis)
• Tham số hoạt động — Qwen3.8-Max: Vẫn chưa được Alibaba tiết lộ; GLM-5.2: 40B hoạt động (Artificial Analysis)
• Cửa sổ ngữ cảnh — Qwen3.8-Max: 1 triệu token, giá cố định (983.616 với suy luận; đầu ra tối đa 131.072); GLM-5.2: 1 triệu token (Artificial Analysis)
• Terminal-Bench 2.1 — Qwen3.8-Max: 86.6 (do Alibaba công bố); GLM-5.2: 82.7 (do Artificial Analysis thẩm định)
• Chỉ số AA Intelligence — Qwen3.8-Max: Vẫn chưa có điểm; GLM-5.2: 51 (Artificial Analysis)
• Điểm số do nhà cung cấp khác báo cáo — Qwen3.8-Max: GPQA Diamond 92.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (do Alibaba báo cáo); GLM-5.2: xếp hạng do bên thứ ba đo lường
• Phương thức — Qwen3.8-Max: Văn bản, hình ảnh, video đầu vào → văn bản đầu ra; GLM-5.2: Tập trung vào văn bản
• Giá (đầu vào / đầu ra) — Qwen3.8-Max: $2.00 / $6.00 trên 1M, cố định; đầu vào cache $0.25; GLM-5.2: $0.95 / $3.00 trên 1M (AA pha trộn ~$0.90)
• Trọng số mở — Qwen3.8-Max: Hứa hẹn trong tuần này (chưa có giấy phép); GLM-5.2: Có — tải được ngay hôm nay
Hai yếu tố làm nền cho sự so sánh này, và yếu tố đầu tiên là điểm dữ liệu hữu ích nhất trong toàn bộ chuỗi.
Đầu tiên, sự trùng lặp với Terminal-Bench thực sự đáng tin cậy. Terminal-Bench 2.1 đo lường liệu một mô hình có thể vận hành một shell thực tế đến hoàn thiện hay không — chạy lệnh, đọc kết quả, phục hồi từ lỗi. Đây là chỉ số gần nhất hiện có để đánh giá "liệu mô hình có thể hoạt động như một tác tử lập trình thay vì một trình gợi ý mã," và đây là benchmark mà cả hai nhà cung cấp đều chọn để báo cáo. Qwen với 86.6 so với con số đã kiểm toán 82.7 của GLM là lợi thế 3,9 điểm nghiêng về Qwen.
Điểm lưu ý này quan trọng nhưng không nên bị phóng đại. Bộ khung của nhà cung cấp và bộ khung đánh giá khác nhau về scaffolding, chính sách thử lại và cách xây dựng prompt, và những lựa chọn đó có thể làm thay đổi điểm Terminal-Bench hơn bốn điểm. Vì vậy, đây không phải bằng chứng cho thấy Qwen là mô hình agent tốt hơn. Điều mà nó xác lập là tuyên bố tự báo cáo của Qwen nằm trong cùng dải cạnh tranh với một mô hình trọng số mở tiên phong đã được kiểm toán, thay vì nằm ở vùng khó tin. Đó là một vị thế có ý nghĩa mạnh mẽ hơn so với "không được chấm điểm".
Thứ hai, so sánh kiến trúc là nơi GLM âm thầm chiến thắng. GLM-5.2 kích hoạt 40B tham số trong tổng số 753B. Con số duy nhất đó cho bạn biết chi phí phục vụ, đặc tính độ trễ của nó, và rằng một đội ngũ được trang bị tốt thực sự có thể chạy được nó. Alibaba vẫn chưa công bố số lượng tham số kích hoạt của Qwen — điều đó có nghĩa là dù con số 2,4T trong tiêu đề có nói lên điều gì đi nữa, không ai ngoài Alibaba có thể ước tính chi phí phục vụ của Qwen3.8-Max hoặc cách nó sẽ hoạt động khi tự triển khai. Trong một phép so sánh Mixture-of-Experts, đó không phải là một chi tiết phụ; đó là con số còn thiếu quan trọng nhất.

Tinh gọn và đã được kiểm chứng so với đồ sộ và chưa được kiểm chứng.
Trường hợp của GLM-5.2 được xây dựng trên một lập trường kỹ thuật nhất quán: làm nhiều hơn với ít hơn, công bố số liệu, phát hành trọng số. Một mô hình 40B-active thì rẻ để phục vụ, nhanh về mặt thiết kế, và có thể triển khai bởi một đội ngũ có ngân sách GPU nghiêm túc nhưng không quá phi lý. Chỉ số {{1}}được kiểm toán độc lập{{/1}} là 51 và điểm Terminal-Bench {{2}}được kiểm toán độc lập{{/2}} là 82,7 đồng nghĩa với việc người mua không phải tin bất cứ điều gì một cách mù quáng. Và ở mức giá $0,95 / $3,00, nó rẻ hơn khoảng một nửa so với giá của Qwen.
Trường hợp của Qwen3.8-Max là một canh bạc ngược lại: xây dựng mô hình lớn nhất có thể và để năng lực biện minh cho chi phí. GA đã làm cho lập luận đó trở nên mạnh mẽ hơn nhiều so với trước, vì cuối cùng đã có những con số đi kèm — GPQA Diamond 92.6 trong khoa học sau đại học, OSWorld-Verified 86.1 trong thao tác GUI, FrontierSWE 73.5 so với 40.7 của phiên bản tiền nhiệm, cùng với Terminal-Bench 86.6 đã đề cập ở trên. Đó là những con số mang tầm tiên phong, và việc gần như tăng gấp đôi trên FrontierSWE là kiểu bước nhảy thế hệ rất khó để làm giả hoàn toàn.
Nhưng hai lỗ hổng vẫn còn, và chúng cũng chính là hai điều đã quan trọng vào tháng Bảy. Có sự thiếu vắng điểm số độc lập — Artificial Analysis và LMArena vẫn chưa được chấm điểm cho Qwen3.8-Max, vì vậy mọi tuyên bố về chất lượng đều do chính Alibaba đưa ra. Và còn có sự thiếu vắng giấy phép, vì vậy lời hứa về trọng số mở chưa thể được đánh giá về mặt thương mại.
Mốc lịch sử ở đây bất lợi cho Qwen hơn so với hầu hết các cặp so sánh: phiên bản tiền nhiệm Qwen3.7-Max đạt 46 trên chỉ số AA, thấp hơn 51 của GLM-5.2. Vì vậy, tuyên bố ngầm của Alibaba không chỉ đơn thuần là Qwen3.8-Max tốt, mà còn rằng nó đã vượt từ dưới GLM lên trên hẳn chỉ trong một thế hệ. Sự cải thiện FrontierSWE mang lại một chút độ tin cậy cho điều đó. Một điểm số độc lập sẽ giải quyết vấn đề.

Chi phí thực tế: con số 2× nằm ở đâu
Xét một pipeline lập trình tác tử: 180,000 token ngữ cảnh kho mã nguồn, 10,000 token đầu ra mỗi lần chạy.
• GLM-5.2: 0.18M × $0.95 = $0.171, cộng 0.01M × $3.00 = $0.03. ≈ $0.20 mỗi lần chạy.
• Qwen3.8-Max: 0.18M × $2 = $0.36, cộng 0.01M × $6 = $0.06. ≈ $0.42 mỗi lần chạy.
• Ở mức 3.000 lần chạy/ngày: GLM ≈ $603/ngày; Qwen ≈ $1.260/ngày — cách nhau khoảng $20.000/tháng.
• Với đầu vào được lưu cache của Qwen ở mức $0.25/1M trên một repo ổn định, chi phí chạy của nó giảm xuống còn ≈ $0.11, điều này thực sự rẻ hơn chi phí không lưu cache của GLM.
Câu cuối cùng là điều thực tế hữu ích nhất trong so sánh này. Giá niêm yết của Qwen gấp đôi GLM, nhưng tỷ lệ cache-hit của nó là $0.25 mỗi 1M đủ mạnh để một pipeline được cache tốt có thể đảo ngược thứ hạng. Nếu agent của bạn đọc lại một ngữ cảnh gần như không thay đổi trong mỗi lượt — điều này mô tả hầu hết các agent lập trình — thì Qwen có thể là lựa chọn rẻ hơn trên thực tế mặc dù bảng giá kém hơn. Các nhóm không cấu hình cache sẽ phải trả gấp đôi mà không được gì.
Cả hai mô hình đều tính token suy luận như đầu ra, vì vậy các cấu hình nặng về suy luận sẽ tốn kém hơn so với các ước tính này ở cả hai phía.
Khả năng triển khai: trục mà GLM làm chủ
Cả hai đều là mô hình MoE trọng số mở của Trung Quốc với tuyên bố ngữ cảnh 1 triệu token, điều này khiến khả năng triển khai trở thành ranh giới thực tế rõ rệt nhất.
Các trọng số của GLM-5.2 đã có thể tải xuống kể từ tháng Sáu, và với 40B tham số kích hoạt, nó là một mục tiêu tự lưu trữ khả thi — có thể lượng tử hóa, có thể triển khai trên một số GPU hợp lý, và đã được cộng đồng sử dụng.
Trọng số của Qwen3.8-Max được hứa hẹn sẽ có trong tuần này, nhưng mô hình hàng đầu không phải là mục tiêu thực tế với bất kỳ ai: khoảng 1,2TB ở mức 4-bit so với khoảng 141GB mỗi H200 nghĩa là cần tám hoặc nhiều hơn bộ tăng tốc cao cấp, và số lượng tham số hoạt động không được tiết lộ khiến thông lượng tạo ra không thể dự đoán trước. Cộng thêm giấy phép còn thiếu và việc tự lưu trữ mô hình hàng đầu hiện tại không phải là một kế hoạch.
Được công bố đồng thời, Qwen3.8-27B là câu trả lời thực sự của Alibaba trên trục này. Cũng mở trọng số và được báo cáo là chạy với khoảng 17GB VRAM — một chiếc card cao cấp duy nhất, thấp hơn nhiều so với mức tiêu thụ của GLM-5.2 — nó cạnh tranh trực tiếp về khả năng triển khai. Nếu bạn quan tâm đến việc tự chạy một trong hai mô hình, so sánh Qwen 27B với GLM-5.2 mới thực sự quan trọng, và đó là cuộc đấu cân sức hơn nhiều so với 2.4T đấu 753B.
FAQ
Liệu Qwen 3.8 có tốt hơn GLM-5.2 không?
Tại một benchmark duy nhất mà cả hai cùng tham gia, Qwen tuyên bố dẫn trước — Terminal-Bench 2.1 đạt 86,6 so với 82,7 đã được kiểm toán của GLM. Nhưng con số của Qwen là tự báo cáo còn của GLM được Artificial Analysis đo lường, và sự khác biệt về bộ công cụ kiểm thử có thể vượt quá khoảng cách 4 điểm. GLM-5.2 cũng sở hữu chỉ số kiểm toán là 51 trong khi Qwen hoàn toàn không có điểm số độc lập nào. GLM là lựa chọn an toàn hơn; Qwen có trần tiềm năng cao hơn nhưng chưa được xác minh.
Chúng so sánh như thế nào trên Terminal-Bench 2.1?
Qwen3.8-Max đạt 86,6; Artificial Analysis đo GLM-5.2 ở mức 82,7. Đó là khoảng cách danh nghĩa 3,9 điểm nghiêng về Qwen và là lần đầu tiên hai mô hình này trùng nhau trên cùng một bài kiểm chuẩn. Nên coi đây là bằng chứng cho thấy Qwen có sức cạnh tranh trong phân khúc đó thay vì bằng chứng khẳng định Qwen vượt trội, vì chỉ con số của GLM mới được sản xuất một cách độc lập.
Cái nào rẻ hơn?
GLM-5.2 trên bảng giá — $0,95 / $3,00 mỗi 1M (AA pha trộn ~$0,90) so với $2 / $6 của Qwen, khoảng một nửa. Nhưng đầu vào cache của Qwen ở mức $0,25 mỗi 1M đủ mạnh đến mức một pipeline được cache nhiều có thể rẻ hơn trên Qwen so với GLM không cache.
Qwen 3.8 Max sử dụng bao nhiêu tham số hoạt động?
Alibaba chưa bao giờ công bố con số này, ngay cả khi phát hành rộng rãi. Đó là con số quyết định chi phí phục vụ và độ trễ trong mô hình Mixture-of-Experts, vì vậy việc thiếu vắng nó là một khoảng trống thực sự. Ngược lại, GLM-5.2 được ghi nhận với 40B tham số hoạt động trong tổng số 753B tham số.
Tôi thực sự có thể tự lưu trữ cái nào?
GLM-5.2 ra mắt hôm nay — trọng số đã được phát hành và 40B tham số hoạt động khiến nó khả thi. Trọng số của Qwen3.8-Max được hứa hẹn sẽ có trong tuần, nhưng mẫu flagship này cần tám GPU trở lên thuộc lớp H200 với dung lượng ~1,2TB ở định dạng 4-bit, trong khi chưa có giấy phép nào được công bố. Qwen3.8-27B được công bố cùng đợt, được cho là cần ~17GB VRAM, là lựa chọn Qwen có thể triển khai và gần với phân khúc của GLM hơn.
Qwen 3.8 Max đã rời khỏi bản xem trước chưa?
Có, vào ngày 3 tháng 8 năm 2026, với bảng giá công bố và một endpoint tương thích với OpenAI và DashScope. Chiến dịch giảm 90% tín dụng Qoder hồi tháng 7 không còn mô tả cách nó được bán.
Qwen cung cấp điều gì mà GLM-5.2 không có?
Đa phương thức gốc — hỗ trợ đầu vào hình ảnh và video, với chỉ số OmniDocBench 92.1 tự báo cáo cho việc phân tích tài liệu — và ngữ cảnh 1 triệu token được tính phí theo mức cố định, không phụ thu cho lời nhắc dài. GLM-5.2 tập trung vào văn bản, vì vậy đối với các quy trình xử lý tài liệu, ảnh chụp màn hình hoặc video, Qwen không hẳn cạnh tranh với nó mà đang làm một việc khác.
Điểm mấu chốt
Qwen 3.8 vs GLM-5.2 là trận đấu mà tính khả dụng chung mang lại thông tin mới thực sự nhất. Lần đầu tiên Qwen có điểm số trên một benchmark mà một nhà đánh giá độc lập cũng đã chạy, và nó đạt trên GLM: Terminal-Bench 2.1 86.6 so với 82.7. Điều đó đưa Qwen từ "chưa có điểm" lên "khả năng cạnh tranh hợp lý trên nền tảng đo lường", đây là tiến bộ thực sự ngay cả khi tính đến hạn chế tự báo cáo.
Nhưng GLM-5.2 vẫn giữ ngôi vương thực dụng, và nó đạt được điều đó nhờ những thế mạnh không hào nhoáng: giá chỉ bằng một nửa, chỉ số được kiểm toán đạt 51, 40B tham số hoạt động khiến chi phí vận hành dễ dự đoán và việc triển khai trở nên khả thi, cùng bộ trọng số bạn có thể tải về ngay bây giờ. Lời đáp của Qwen — ngữ cảnh triệu token với mức giá cố định, đa phương thức nguyên bản và trần tiềm năng cao hơn — có ý nghĩa nhưng kèm điều kiện, và hai khoảng trống tháng 7 của nó vẫn không đổi: không có điểm số độc lập và không có giấy phép. Hãy theo dõi ba điều: điểm Intelligence Index độc lập đầu tiên cho Qwen3.8-Max, liệu một bên đánh giá có tái tạo được con số 86.6 trên Terminal-Bench hay không, và bản phát hành Qwen3.8-27B — nơi hai triết lý này sẽ thực sự va chạm. Cho đến lúc đó, GLM-5.2 là thứ bạn đưa vào vận hành còn Qwen3.8-Max là thứ bạn đánh giá — với bộ nhớ đệm được bật.

So sánh trong bài viết này3
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
