Thẻ tiêu đề hero cho GLM-5.2 vs Kimi K3 với phụ đề 'Rẻ hơn và nhanh hơn, hay lớn hơn và tốt hơn', ba huy hiệu dạng viên thuốc bo tròn ghi 'Mỗi bên có ngữ cảnh 1M token', 'AA Index 34 vs 44' và '$1.40 / $4.40 vs $3.00 / $15.00', một dòng chân trang ghi 'Bảng giá của nhà cung cấp và Artificial Analysis, 2026-09-23', cùng logo OrcaRouter ở góc dưới cùng bên phải.
Guides & Insights

GLM-5.2 vs Kimi K3: Rẻ hơn và nhanh hơn, hay lớn hơn và tốt hơn

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

GLM-5.2Kimi K3 ra mắt cách nhau một tháng vào giữa năm 2026 và gần như đối lập hoàn hảo với nhau. Kimi K3, được phát hành vào ngày 16/07/2026, còn trọng số mở được tung ra sau đó vào ngày 27/07/2026, là mô hình lớn hơn và trên lý thuyết là tốt hơn: 2,8 nghìn tỷ tham số, 104 tỷ trong số đó hoạt động, và điểm cao hơn trên gần như mọi bài kiểm chuẩn mà cả hai đã được thử nghiệm. GLM-5.2 đã có mặt từ ngày 16/06/2026, là mô hình nhỏ hơn trong hai với 753 tỷ tham số, 40 tỷ hoạt động, và có chi phí trên mỗi token đầu ra chỉ bằng khoảng một phần ba, trả lời nhanh hơn ở mức trung vị, và được phát hành theo giấy phép MIT thay vì một giấy phép riêng có điều khoản kích hoạt theo doanh thu.

Đó là quyết định trong một đoạn văn. Những gì tiếp theo là bằng chứng đằng sau nó — phép tính giá cho một công việc mà bạn có thể thực sự chạy, các phép đo nơi hai bên đủ gần nhau đến mức khác biệt chỉ là nhiễu, và một con số phổ biến không thể so sánh với con số được in ngay bên cạnh nó.

Hai người đứng ở đâu

Cả hai đều thường có sẵn thông qua API riêng của nhà cung cấp, cả hai đều có thể định tuyến trên OrcaRouter, và cả hai đều có trọng số có thể tải xuống. Những khác biệt quan trọng trước khi bạn tiến gần đến bất kỳ benchmark nào:

• Ra mắt — GLM-5.2 vào 2026-06-16 so với Kimi K3 vào 2026-07-16 (các trang mô hình của Artificial Analysis; trang mô hình riêng của OrcaRouter cho Kimi K3 ghi ngày sớm hơn một ngày, 2026-07-15)

• Trọng số — GLM-5.2 mở theo giấy phép MIT so với Kimi K3 mở theo Giấy phép Kimi K3, yêu cầu một thỏa thuận riêng khi doanh thu model-as-a-service hàng năm trên 20 triệu USD và ghi công nổi bật khi có trên 100 triệu người dùng hàng tháng (nghiên cứu và phát triển nội bộ được miễn trừ)

• Kích thước — GLM-5.2 tổng 753B / 40B hoạt động so với Kimi K3 tổng 2,8T / 104B hoạt động

• Ngữ cảnh — GLM-5.2 1.000.000 token so với Kimi K3 1.048.576 token

• Đầu vào — GLM-5.2 văn bản vào, văn bản ra so với Kimi K3 văn bản và hình ảnh vào, văn bản ra

• Số token đầu ra tối đa được công bố — GLM-5.2 128.000 token so với không được công bố trên trang OrcaRouter của Kimi K3

Trên OrcaRouter, cả hai đều nằm sau một khóa duy nhất trên một endpoint tương thích OpenAI tại https://api.orcarouter.ai/v1, và chúng tôi chuyển thẳng giá niêm yết của nhà cung cấp mà không cộng thêm phụ phí — vì vậy mọi con số dưới đây là con số của nhà cung cấp, không phải của chúng tôi.

Một triệu token tốn bao nhiêu, trong một công việc có chi phí

Bảng giá của nhà cung cấp trước tiên, đọc từ chính trang giá của các nhà cung cấp vào ngày 23/09/2026. Z.ai niêm yết GLM-5.2 ở mức 1,40 USD cho mỗi triệu token đầu vào, 0,26 USD cho mỗi triệu token đầu vào được lưu trong bộ nhớ đệm, và 4,40 USD cho mỗi triệu token đầu ra. Moonshot niêm yết Kimi K3 ở mức 3,00 USD cho đầu vào, 0,30 USD cho đọc từ bộ nhớ đệm, 15,00 USD cho đầu ra — cộng thêm phí ghi bộ nhớ đệm là 3,00 USD mỗi triệu cho bộ nhớ đệm năm phút và 6,00 USD mỗi triệu cho bộ nhớ đệm một giờ. Đó là những mức giá được công bố, không phải giá đã được kiểm toán độc lập, và cả hai nhà cung cấp đều có thể thay đổi chúng.

Hãy giao cho chúng một tác vụ chủ yếu là đọc: một bản đánh giá cơ sở mã 600.000 token với câu trả lời viết dài 8.000 token. Trên GLM-5.2, chi phí là 0,6 x 1,40 đô-la = 0,84 đô-la cho đầu vào, cộng với 0,008 x 4,40 đô-la = 0,035 đô-la cho đầu ra, tức khoảng 0,88 đô-la. Trên Kimi K3, chi phí là 0,6 x 3,00 đô-la = 1,80 đô-la cộng với 0,008 x 15,00 đô-la = 0,12 đô-la, tức khoảng 1,92 đô-la. Chi phí cao gấp khoảng 2,2 lần cho cùng một tác vụ.

Giờ hãy chạy lại lần nữa khi mã nguồn đã nằm sẵn trong bộ nhớ đệm của nhà cung cấp. Dòng chi phí đầu vào thu gọn về mức giá đọc bộ nhớ đệm, và hai mức giá vốn chênh nhau 2,1 lần trở thành $0,26 so với $0,30 mỗi triệu token — một khoảng cách 15%. Đây là con số ít được bàn đến nhất trong phần so sánh này, và cũng là con số quan trọng nhất đối với một agent phải đọc lại cùng một ngữ cảnh ở mỗi lượt. Nó còn có một dấu hoa thị: Kimi K3 tính phí riêng cho việc ghi vào bộ nhớ đệm, còn trang của GLM-5.2 hoàn toàn không quảng cáo khoản phí ghi nào, nên một khởi động lạnh sẽ tốn kém hơn đáng kể trên Kimi K3 so với mức $3,00 mà con số tiêu đề gợi ý.

• Một lượt đọc 600k token với câu trả lời 8k — GLM-5.2 khoảng $0,88 so với Kimi K3 khoảng $1,92

• Cùng một dòng đầu vào được lưu trong bộ đệm — GLM-5.2 $0.16 so với Kimi K3 $0.18 mỗi 600k token

A self-built two-column scoreboard for GLM-5.2 vs Kimi K3. Left column 'GLM-5.2' (753B total / 40B active, MIT, $1.40 / $4.40): Intelligence Index 34, blended price per million $0.902, cost per task $0.96, output speed 68.2 tok/s, long context AA-LCR 78%, agentic AutomationBench 28%. Right column 'Kimi K3' (2.8T total / 104B active, Kimi K3 License, $3.00 / $15.00): Intelligence Index 44, blended price per million $2.31, cost per task $2.00, output speed 36.7 tok/s, long context AA-LCR 89%, agentic AutomationBench 58%. Footer reads 'Benchmark, speed and cost figures per Artificial Analysis (Intelligence Index v4.3.2, read 2026-09-23), both models in their maximum-reasoning configuration. Vendor list prices per Z.ai and Moonshot. OrcaRouter passes provider list price through at 0% markup.'

Mô hình độc lập đồng thuận về hướng nhưng không đồng thuận về độ lớn. Artificial Analysis kết hợp token cache-hit, token đầu vào và token đầu ra theo tỷ lệ 7:2:1, đồng thời cộng thêm số token suy luận mà mô hình thực sự tiêu tốn; các số liệu của nó cho hai mô hình này — được đọc vào ngày 2026-09-23 theo chỉ số v4.3.2 của nó — đặt GLM-5.2 ở mức 0,902 USD trên mỗi triệu token hỗn hợp, so với 2,31 USD của Kimi K3, và chi phí hoàn thành một trong các tác vụ đánh giá của nó ở mức 0,96 USD so với 2,00 USD. Chạy toàn bộ Intelligence Index một lần tốn 1.559 USD đối với GLM-5.2 và 3.658 USD đối với Kimi K3.

Có một chi tiết phản trực giác ẩn sâu trong mô hình chi phí đó. Kimi K3 sử dụng ít token đầu ra hơn cho mỗi tác vụ so với GLM-5.2 — 48.000 so với 64.000 — và ít token suy luận hơn, 32.000 so với 51.000. Đây là mô hình tiết kiệm hơn trên mỗi đơn vị công việc và vẫn tốn khoảng gấp đôi cho mỗi tác vụ, vì giá trên mỗi token của nó cao gấp 2,1 lần ở đầu vào và 3,4 lần ở đầu ra. Rẻ theo tác vụ và rẻ theo token là những thuộc tính khác nhau, và đây là một cặp mà chúng chỉ theo hai hướng ngược nhau.

Cửa sổ ngữ cảnh, và những gì thực sự vừa trong đó

Trên giấy tờ, hai mô hình này chỉ chênh nhau trong vòng 5%: 1.000.000 token so với 1.048.576. Coi đó là một chiến thắng của Kimi K3 thì thật ngớ ngẩn. Cả hai đều là mô hình triệu token, và cửa sổ ngữ cảnh không phải là điểm khác biệt; câu hỏi trung thực là mỗi mô hình vẫn có thể làm được gì với đoạn văn bản bị chôn sâu ở giữa cửa sổ đó.

Đó là điều mà đánh giá suy luận ngữ cảnh dài của Artificial Analysis đo lường, và đây là một trong những khoảng cách lớn hơn trong bộ dữ liệu: Kimi K3 đạt 89% so với 78% của GLM-5.2. Nếu công việc của bạn là nạp một kho ngữ liệu lớn rồi đặt những câu hỏi đòi hỏi phải ghép các dữ kiện từ hai đầu đối diện của nó, thì 48,576 token thêm vào không phải là lý do để chọn Kimi K3 — mà chính mức chênh lệch mười một điểm về ngữ cảnh dài mới là lý do.

Mức sàn dưới cửa sổ cũng khác. GLM-5.2 công bố đầu ra tối đa 128.000 token; trang của Kimi K3 không công bố một con số tương đương, nên chúng tôi sẽ không đưa ra con số nào. Nếu bạn đang tạo tài liệu dài thay vì đọc chúng, sự bất đối xứng đó đáng để đối chiếu với khối lượng công việc của riêng bạn trước khi mua một trong hai.

Tốc độ: trục duy nhất mà GLM-5.2 làm chủ hoàn toàn

Hai phép đo độc lập cùng chỉ về một hướng ở đây, và điều này đáng để nói ra chính bởi vì chúng không đồng thuận với nhau về mọi thứ.

Dữ liệu định tuyến của chúng tôi, trong bảy ngày tính đến 2026-09-23, cho thấy GLM-5.2 trả lời với thời gian trung vị đến token đầu tiên là 3,28 giây, so với 8,09 giây của Kimi K3, và truyền phát 68,1 token mỗi giây so với 43,4. Thời gian p95 đến token đầu tiên của cả hai mô hình đều đúng 10,00 giây. Artificial Analysis, đo lường riêng, ghi nhận GLM-5.2 đạt 68,2 token đầu ra mỗi giây so với 36,7 của Kimi K3, với 41,29 giây end-to-end so với 72,13, và 33,95 giây đến câu trả lời đầu tiên so với 58,52.

A screenshot of the OrcaRouter model page for GLM 5.2 (z-ai/glm-5.2) captured 2026-09-23, showing the FEATURED badge, the byline 'by Z.ai · 2026-06-16', a 1M-token context with 128K maximum output and text in / text out, rate cards of $1.40 input and $4.40 output per 1M tokens with a $0.260 cache read, a p50 time to first token of 3.28 s against a p95 of 10.00 s, 29.4M tokens of traffic in the last 7 days, and a PERFORMANCE panel showing an output speed of 68.1 tokens per second and a 9.2% error rate.

Hai nguồn này khác nhau ở một điểm, và điều đó đáng được nêu ra hơn là lấp liếm cho qua. Artificial Analysis đánh giá Kimi K3 nhỉnh hơn một chút về thời gian tới token đầu tiên thô, 4,08 giây so với 4,62, trong khi hệ thống định tuyến của chúng tôi cho thấy GLM-5.2 nhanh gần gấp hai lần rưỡi ở p50. Khác endpoint, khác nhà cung cấp thượng nguồn, khác khoảng thời gian đo. Hãy coi hướng thông lượng — GLM-5.2 nhanh hơn một cách thoải mái — là đáng tin cậy, và coi bất kỳ con số thời gian tới token đầu tiên đơn lẻ nào, của chúng tôi hay của họ, là đặc trưng của một tuần cụ thể.

Trên trang GLM-5.2 của chúng tôi cũng có một con số mà chúng tôi sẽ không lặng lẽ bỏ sót: trong cùng bảy ngày đó, nó cho thấy tỷ lệ lỗi 9,2%, so với 0,26% của Kimi K3. Một khoảng cách lớn như vậy thì khả năng là do một tuần tồi tệ đối với các nhà cung cấp thượng nguồn phục vụ GLM-5.2 cũng ngang với khả năng đó là một đặc tính của mô hình, và bảy ngày không phải là khoảng thời gian đủ dài để phân biệt đâu là đâu. Đây chính là kiểu vấn đề mà định tuyến tồn tại để giải quyết — khi một nhà cung cấp để lỗi một trong mười một yêu cầu, cơ chế chuyển đổi dự phòng tự động sẽ chuyển lưu lượng mà không cần ai gọi on-call.

A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3) captured 2026-09-23, showing the FEATURED badge, the byline 'by MoonshotAI · 2026-07-15', text-and-image input with text output, a 1,048,576-token context, rate cards of $3.00 input and $15.00 output per 1M tokens with a $0.300 cache read, a p50 time to first token of 8.09 s against a p95 of 10.00 s, 1116.2M tokens of traffic in the last 7 days, and a PERFORMANCE panel showing an output speed of 43.4 tokens per second and a 0.26% error rate.

Điểm chuẩn: một chiến thắng áp đảo thực sự, nhưng hẹp hơn so với tiêu đề

Kimi K3 thắng gần như mọi thứ mà cả hai mô hình đã được chạy trên đó. Đây là các số liệu của Artificial Analysis theo bản sửa đổi chỉ số v4.3.2, cả hai mô hình ở cấu hình suy luận tối đa, đọc ngày 2026-09-23:

• Chỉ số Thông minh — Kimi K3 44 so với GLM-5.2 34

• AA-Briefcase v1.1 — 1510 so với 1233

• GDPval-AA v2.1 — 1524 so với 1358

• AutomationBench-AA — 58% so với 28%

• Terminal-Bench 4.0 — 13% so với 1%

• SciCode — 59% so với 51%

• Humanity's Last Exam — 47% so với 41%

• GDP.pdf — 22% so với 10%

• AA-LCR v1.1 — 89% so với 78%

• CritPt — 23% so với 21%

Hai lưu ý trước khi bất kỳ ai chụp màn hình danh sách đó.

Đầu tiên, việc sửa đổi chỉ số. Các bài đưa tin về màn ra mắt tháng 7 của Kimi K3 dẫn số điểm của nó là 57 trên Intelligence Index, còn GLM-5.2 là 51. Các trang trực tuyến hôm nay lại ghi 44 và 34. Đó không phải cùng một phép đo — Artificial Analysis sửa đổi chỉ số và chấm điểm lại các mô hình theo chỉ số đó, và việc đặt một con số tháng 7 cạnh một con số tháng 9 là lỗi dễ mắc nhất với cặp so sánh này. Xu hướng thì ổn định qua mọi ảnh chụp nhanh; các con số tuyệt đối thì không thể so sánh giữa các lần sửa đổi.

Thứ hai, các mức điểm. Terminal-Bench 4.0 ở 13% và 1% là một đánh giá khó, và ở tầm đó, tỷ lệ cho bạn biết nhiều hơn so với từng con số riêng lẻ. AA-Omniscience, bài kiểm tra xem một mô hình có biết giới hạn hiểu biết của chính nó hay không, cho GLM-5.2 đạt 4 so với 20 của Kimi K3 — một mức sàn đáng để biết nếu bạn định chạy một trong hai mà không có giám sát.

Một điều nữa mà Artificial Analysis ghi nhận về mục GLM-5.2: nó đánh dấu cấu hình suy luận tối đa là không còn được khuyến nghị, nhường chỗ cho GLM-5.3 mới hơn. Điều đó không thay đổi bất kỳ số liệu nào ở trên, vốn là ảnh chụp nhanh của GLM-5.2 tại thời điểm được đo, nhưng nó thực sự có nghĩa là lộ trình của Z.ai đã vượt qua mô hình này. Trên một endpoint định tuyến, việc đó chỉ tốn một chuỗi mô hình thay vì một cuộc di trú, và đây là lập luận chính cho việc không mã hóa cứng một trong hai cái tên này vào ứng dụng của bạn.

Tác nhân và việc sử dụng công cụ: nơi khoảng cách rộng nhất

Nếu chỉ một khối trong bảng đó quyết định việc mua, thì chính là khối này. Công việc agentic tầm xa là nơi lợi thế của Kimi K3 lớn nhất và ổn định nhất:

• AutomationBench-AA — 58% so với 28%, khoảng cách 30 điểm

• GDPval-AA v2.1 — 1524 so với 1358

• AA-Briefcase v1.1 — 1510 so với 1233

• Terminal-Bench 4.0 — 13% so với 1%

Tài liệu phát hành của chính Moonshot cũng dựa vào cùng câu chuyện đó — bản phát hành trọng số K3 đi kèm một báo cáo kỹ thuật bao quát ngăn xếp huấn luyện song song theo chuyên gia của nhà cung cấp và một bộ khung môi trường tác nhân — nhưng tài liệu của nhà cung cấp thì vẫn là tài liệu của nhà cung cấp, còn những con số ở trên mới là những con số độc lập.

Trình tổng hợp bên thứ ba LLM Stats, đơn vị tự chạy một chỉ số tổng hợp riêng trên một bộ benchmark dùng chung, đi đến cùng kết luận từ một hướng khác: trong mười một benchmark mà nó chấm điểm cho cả hai mô hình, Kimi K3 thắng cả mười một, và điểm theo hạng mục của nó đặt Kimi K3 vượt trội ở sử dụng công cụ (30.8 so với 19.6), tác nhân (38.3 so với 29.6) và lập trình (42.3 so với 34.8). Đó là các chỉ số tổng hợp của chính LLM Stats theo cách tính trọng số riêng của nó, trên một bộ dùng chung không lớn, nên hãy coi chúng như sự củng cố hơn là một kết quả từ phòng thí nghiệm. Mười một trên mười một vẫn không phải là một kết quả sát nút.

Lập trình

Cùng hướng, mức chênh nhỏ hơn. Trên các đánh giá lập trình mà Artificial Analysis chấm điểm cho cả hai, Kimi K3 dẫn trước ở SciCode với 59% so với 51%; trên bộ dùng chung của LLM Stats, nó thắng DeepSWE, DeepSWE 1.1, FrontierSWE, SWE-Marathon, Program Bench và Terminal-Bench 2.1. Những con số đẹp đẽ của GLM-5.2 — 99,2% trên AIME 2026, 94,4% trên HMMT 2025, 91,2% trên GPQA như được các đơn vị tổng hợp bên thứ ba đăng tải — là do nhà cung cấp tự báo cáo và chưa được tái lập, và phần lớn chúng đo lường toán học thi đấu chứ không phải kỹ thuật phần mềm.

Cách nhìn thực tế: với một coding agent chạy trong thời gian dài, chỉnh sửa nhiều tệp và phải tự khắc phục sai sót của chính mình, thì lợi thế agentic của Kimi K3 là tín hiệu đáng quan tâm hơn so với điểm toán của cả hai mô hình. Còn với một trợ lý lập trình nhanh, rẻ, phần lớn chỉ chạy một lần, thì lợi thế về thông lượng của GLM-5.2 đáng giá hơn so với cái mất đi vì khoảng cách benchmark.

Khi chúng đủ gần nhau đến mức không còn quan trọng nữa

• Giá đầu vào được cache — $0,26 so với $0,30 mỗi triệu, mức chênh lệch 15% so với mức chênh lệch gấp 3,4 lần ở đầu ra.

• Cửa sổ ngữ cảnh — 1,000,000 so với 1,048,576 token

• thời gian đến token đầu tiên ở p95 — 10,00 giây so với 10,00 giây trên hệ thống định tuyến của riêng chúng tôi

• CritPt — 23% so với 21%

• Toán học — LLM Stats đưa GLM-5.2 nhỉnh hơn một chút trên điểm tổng hợp toán học của mình (41,4 so với 40,9), trong khi Kimi K3 dẫn đầu ở mảng toán học kèm hình ảnh; dựa trên bằng chứng hiện có, không mô hình nào thực sự vượt trội về số học

Bất kỳ ai nói với bạn rằng một trong những mô hình này gấp đôi mô hình kia trên mọi phương diện thì chỉ đang đọc một hàng duy nhất của bảng.

Chọn GLM-5.2 nếu…

Bạn là người trả hóa đơn và hóa đơn chính là ràng buộc. GLM-5.2 có giá đầu ra chỉ khoảng một phần ba, cũng rẻ hơn ở mức giá cache, được cấp phép theo MIT mà không có điều kiện kích hoạt doanh thu nào để đối chiếu, nhanh hơn ở mức trung vị và nhanh hơn nhiều khi streaming, và cửa sổ một triệu token của nó đủ gần với của Kimi K3 đến mức sự khác biệt sẽ không bao giờ quyết định điều gì. Nếu khối lượng công việc của bạn là văn bản vào và văn bản ra, và phần lớn là đọc thay vì những chuỗi gọi công cụ dài, thì những điểm benchmark cộng thêm trên Kimi K3 là những điểm mà ứng dụng của bạn sẽ không bao giờ ghi được.

Chọn Kimi K3 nếu…

Công việc mang tính agentic và kéo dài. Khoảng cách 30 điểm trên AutomationBench, vị trí dẫn đầu trên GDPval và AA-Briefcase, lợi thế 11 điểm về suy luận ngữ cảnh dài và việc thắng sạch bộ dùng chung của LLM Stats đều chỉ về cùng một hướng: Kimi K3 là mô hình tốt hơn để giao một tác vụ đa bước rồi rời đi. Nó cũng là mô hình duy nhất trong hai mô hình chấp nhận hình ảnh. Bạn sẽ trả khoảng gấp đôi cho mỗi tác vụ vì điều đó, và nếu tập làm việc của bạn được cache nhiều thì bạn sẽ trả ít hơn gấp đôi — nhưng lý lẽ ủng hộ nó không phải là giá, và cũng không phải là tốc độ.

Cả hai đều có thể được định tuyến trên OrcaRouter chỉ với một khóa duy nhất tới một endpoint tương thích với OpenAI, theo giá niêm yết của các nhà cung cấp, không cộng thêm bất kỳ khoản nào, và cả hai đều nằm sau cùng một cơ chế chuyển đổi dự phòng tự động. Đó là cách rẻ nhất để tìm ra xem khối lượng công việc của bạn thực sự muốn cái nào, bởi vì việc chuyển đổi giữa chúng chỉ là đổi một chuỗi model chứ không phải một hợp đồng.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày