
GLM-5.3 vs Kimi K3: Khai thác tối đa mô hình nền 743B hay xây dựng mô hình 2.8T — Cược nào sẽ thắng?
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0455Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0247Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0247Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0157Trí tuệ82Lập trình
- AlibabaMỚIQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.3 Flash2026-08-2646Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1849Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1541Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1251Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0547Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0347Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2140Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Trí tuệ49Lập trình
Cuộc đua trọng số mở của Trung Quốc vừa tách ra thành hai câu trả lời cho cùng một câu hỏi. Moonshot AI đã xây dựng Kimi K3từ đầu — một mô hình hỗn hợp chuyên gia với 2,8 nghìn tỷ tham số, mô hình trọng số mở lớn nhất từng được phát hành, công bố ngày 16 tháng 7 năm 2026 và trọng số theo sau vào ngày 27 tháng 7. GLM-5.3là lựa chọn ngược lại: Z.ai giữ nguyên mô hình nền 743 tỷ tham số chính xác đã cung cấp sức mạnh cho GLM-5.2 và dành toàn bộ chu kỳ phát hành cho post-training, cho rằng trần trí thông minh của mô hình nền chưa bao giờ là vấn đề. Cả hai đều là mô hình chủ lực có ngữ cảnh 1M, tập trung vào lập trình và tác nhân AI, và cả hai đều tuyên bố là mô hình mở lập trình tốt nhất thị trường. Chúng không thể đều là cách tốt nhất để chi cùng một ngân sách, và các benchmark thực sự chia đôi — khiến đây không phải là một sự so sánh mà là một cuộc trưng cầu về cách xây dựng mô hình tiên phong tiếp theo.
Hai đặt cược về cách xây dựng một mô hình tiên phong
Z.ai gọi GLM-5.3 là một bước "đào sâu" (deep dig) thay vì một bản nâng cấp mang tính thế hệ. Phần nền tảng giống hệt từng byte với mô hình 743B của GLM-5.2; phần khác biệt nằm hoàn toàn ở khâu hậu huấn luyện, được chạy qua framework slime mã nguồn mở trên các tác vụ trải dài suốt các phiên làm việc kỹ thuật — chẩn đoán, sửa lỗi, xác minh và phát hành trên các cụm máy thực, hệ thống lưu trữ và kho mã nguồn, một số tác vụ tốn đến vài ngày công của một kỹ sư cấp cao. Mức tăng mà hãng công bố là rất lớn: tăng vọt 50% trên Code Bench của chính hãng, Terminal-Bench 3.0 từ 4,6 lên 28,3, DeepSWE v1.1 từ 46,2 lên 66,9, cùng một năng lực tấn công mạng buộc phải rà soát an toàn trước khi phát hành trọng số. Moonshot đi theo hướng ngược lại. Kimi K3 là một nền tảng hoàn toàn mới — tổng tham số 2,8T với khoảng 104B tham số kích hoạt cho mỗi token (16 trong số 896 chuyên gia), kiến trúc Kimi Delta Attention, hỗ trợ trực tiếp đầu vào hình ảnh và video, khả năng suy luận luôn bật không thể tắt, cùng cửa sổ ngữ cảnh 1M cho cả đầu vào lẫn đầu ra. Trong khi Z.ai đặt cược rằng khai thác thêm từ cùng một mô hình là đủ, thì Moonshot đặt cược rằng bản thân nền tảng mới chính là giới hạn.

Trận đối đầu, kèm theo nguồn gốc xuất xứ
Nơi duy nhất cả hai mô hình xuất hiện trên cùng một trang là bảng ra mắt của chính Z.ai, do đó các con số so sánh trực tiếp đều bắt nguồn từ đó — được ghi chú là do nhà cung cấp báo cáo, chưa được kiểm toán độc lập. Các số liệu riêng lẻ của Kimi K3 khớp với những gì Moonshot công bố vào tháng 7 và những gì Artificial Analysis đo lường, nhưng chưa có phòng thí nghiệm trung lập nào chạy thử cả hai mô hình.
• Terminal-Bench 3.0 — GLM-5.3 đạt 28.3 so với Kimi K3 đạt 17.4 (bảng của Z.ai). Khoảng cách về khả năng lập trình lớn nhất trong cuộc so tài này, trên phiên bản mới nhất và khó nhất.
• Terminal-Bench 2.1 — GLM-5.3 đạt 88.2 so với Kimi K3 đạt 88.3. Bất phân thắng bại.
• DeepSWE v1.1 — GLM-5.3 đạt 66.9 so với Kimi K3 đạt 67.5. Kimi nhỉnh hơn một chút.
• SWE-Marathon v1.1 — GLM-5.3 đạt 42.5 so với Kimi K3 đạt 48.1. Chiến thắng lập trình tốt nhất của Kimi.
• ExploitGym — GLM-5.3 đạt 105/130 so với Kimi K3 đạt 36/70. Một cú quét gần như toàn diện cho GLM.
• GDPval-AA v2 (công việc tri thức) — GLM-5.3 ở mức 1,769 so với Kimi K3 ở mức 1,682.
• Truy cập — GLM-5.3: đăng ký Coding Plan, trọng số bị khóa cho đến khoảng ngày 28 tháng 8. Kimi K3: API đã hoạt động với giá $3 / $15, trọng số có thể tải xuống từ ngày 27 tháng 7.

Hào rào bảo mật mới chính là sự tách biệt thực sự.
Nếu bỏ qua các bài đánh giá lập trình, sự khác biệt quyết định nằm ở an ninh mạng. GLM-5.3 đạt 84.5 trên CyberGym so với 80.0 của Kimi K3, và điểm ExploitBench của nó là 54.4, gần gấp đôi mức 32.2 của Kimi K3. Trên ExploitGym, khoảng cách này không chỉ là sự khác biệt mà là một hạng mục khác hẳn — 105 và 130 so với 36 và 70 trong các lượt chạy 2 giờ và 6 giờ. Đó là lý do tại sao hai lần ra mắt lại có cảm giác khác biệt đến vậy trong thực tế: trọng số của Kimi K3 được công khai dưới giấy phép MIT sửa đổi, trong khi trọng số của GLM-5.3 bị giữ lại để củng cố an toàn, chính xác là vì Z.ai cho rằng mô hình này đủ giỏi trong việc tìm kiếm và khai thác lỗ hổng đến mức việc phát hành trọng số ngay lập tức bị coi là thiếu trách nhiệm. Nếu công việc của bạn liên quan đến việc kiểm toán mã nguồn của người khác, hoặc bảo vệ mã nguồn của chính mình trước các cuộc săn lùng lỗ hổng tự động, thì đây là điểm liên quan nhất trong toàn bộ so sánh — và cũng là điểm ít được xác minh độc lập nhất.
Nơi Kimi K3 chống trả
Các chiến thắng của Kimi K3 tập trung vào nơi GLM-5.3 yếu nhất: công việc repository dài hạn. Nó giữ lợi thế trên DeepSWE và SWE-Marathon, dẫn đầu trên Toolathlon Verified, và cửa sổ đầu ra 1 triệu token của nó cho phép viết toàn bộ codebase hoặc một chuỗi hoạt động agent dài trong một lần duy nhất. Khả năng suy luận luôn bật của nó truyền toàn bộ chuỗi hoạt động đến API, điều mà các nhà phát triển đánh giá là hữu ích hơn nhiều cho việc gỡ lỗi agent so với các bản giải thích tóm tắt khó hiểu — với điểm vướng mắc khi vận hành là bạn phải truyền lại nguyên văn các trường suy luận qua các lần gọi công cụ và không có prefill trợ lý. Trên Intelligence Index của Artificial Analysis, Kimi K3 đạt 57, đứng thứ tư tổng thể, với chi phí khoảng 0,94 USD mỗi tác vụ được đo trên bộ tiêu chuẩn của nó. Đây cũng là mô hình đắt nhất mà một phòng thí nghiệm Trung Quốc từng phát hành: 3 USD mỗi triệu token đầu vào và 15 USD mỗi triệu token đầu ra, mức giá phân khúc Sonnet, trong khi GLM-5.3 vẫn chưa thể định giá theo token vì nó chỉ tồn tại trong một gói đăng ký.
Thực tế về khả năng tiếp cận và chi phí
Kimi K3 hiện đang có trên OrcaRouter với đúng giá niêm yết của Moonshot — 3 đô la / 15 đô la mỗi triệu token, 0,30 đô la cho lượt đọc cache, phụ phí 0% — nên công việc agent với ngữ cảnh 1 triệu token có thể được gọi trên cùng một khóa API với phần còn lại của hệ thống, và các trọng số mở chính là lựa chọn thoát hiểm nếu bạn muốn tự lưu trữ. GLM-5.3 là mô hình khó tiếp cận hơn: gói đăng ký hàng tháng từ 18 đến 168 đô la với hệ thống điểm, tiêu tốn tín dụng gấp 6,9 lần cho đầu vào và 24 lần cho đầu ra, giá ngoài giờ cao điểm giảm một nửa mức tiêu hao ngoài khung giờ 14:00–18:00 theo giờ Trung Quốc, và chưa có API tính theo token cho đến khi quá trình đánh giá an toàn hoàn tất. Lớp định tuyến thực sự làm phẳng sự bất đối xứng này trong khoảng thời gian hai tuần: khi API của GLM-5.3 xuất hiện trên cùng một khóa, một cuộc gọi panel có thể chạy cả hai mô hình mã nguồn mở hàng đầu trên các tác vụ của riêng bạn và để bộ đánh giá phân xử chúng — và nếu bạn không thể chờ đợi, trọng số đã phát hành sẵn của Kimi K3 khiến nó trở thành mô hình duy nhất trong hai mô hình mà bạn có thể triển khai hoàn toàn tại chỗ ngay hôm nay.

Cược nào đang trả thưởng
Kết luận thẳng thắn sau một tuần là cả hai lựa chọn đều đang phát huy hiệu quả, nhưng ở những khối lượng công việc khác nhau. Nếu công việc của bạn thiên về terminal, gắn với bảo mật và do agent điều phối, thì GLM-5.3 là hướng đi mạnh hơn dựa trên bằng chứng mà Z.ai đã công bố — và khoảng cách về an ninh mạng đủ lớn để đáng chờ hai tuần lấy weights về tự kiểm chứng. Nếu công việc của bạn là những phiên làm việc dài với repository, đầu vào đa phương thức, hoặc bất cứ điều gì cần weights trong tay ngay hôm nay, thì Kimi K3 là mô hình duy nhất trong hai mô hình thực sự có sẵn — và các chiến thắng deep-repo của nó là điều bạn có thể xác minh ngay bây giờ từ API trực tiếp của nó. Điều cần nắm rõ: mọi con số trong phần so sánh trực diện này đều đến từ bảng số liệu của chính Z.ai, nên hãy coi các chênh lệch về code chỉ mang tính định hướng cho đến khi một phòng thí nghiệm độc lập chạy thử cả hai. Đó chính là kiểu xác minh mà hai tuần chờ đợi sẽ mang lại.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
