Thẻ tiêu đề cho 'Muse Spark 1.2 vs GLM-5.2 — lập trình viên đóng vs mô hình đa năng mở', với Muse Spark 1.2 được hiển thị dưới biểu tượng ổ khóa ĐÓNG và GLM-5.2 dưới biểu tượng hộp MỞ.
Guides & Insights

Muse Spark 1.2 vs GLM 5.2: Trình mã hóa đóng vs Trợ lý đa năng mở

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai mô hình ngữ cảnh 1.000.000 token, giá chênh lệch trong vòng mười lăm xu mỗi triệu token, cả hai đều nhắm đến công việc agent nặng về mã — và chúng gần như không có điểm chung nào khác. Muse Spark 1.2, được Meta phát hành vào ngày 5 tháng 8 năm 2026 cùng với một agent đầu cuối được huấn luyện đồng thời tên là Muse Code, là mô hình trọng số đóng, rẻ hơn mỗi token, đạt 57 điểm trên Artificial Analysis Intelligence Index hiện tại, và không thể trả lời nếu không suy luận trước. GLM 5.2, mô hình trọng số mở hàng đầu của Z.ai từ giữa tháng 6, được cấp phép MIT, có thể tự lưu trữ, nhanh hơn khoảng năm lần tính từ token đầu tiên, và vẫn mang lượng truy cập thực tế gấp bốn lần rưỡi qua cổng của chúng tôi — 213 triệu token trong bảy ngày qua so với 46 triệu của Muse Spark 1.2. Mô hình đạt điểm cao hơn, rẻ hơn mỗi token lại là mô hình có ít lưu lượng hơn. Mô hình mở mới là mô hình mà mọi người thực sự định tuyến.

Phiên bản trung thực của sự thật đó là điều bài viết này đề cập đến. Điểm số và giá cả ít quyết định hơn cách một mô hình phù hợp với pipeline của bạn, và hai mô hình này đưa ra những lựa chọn trái ngược nhau trên mọi khía cạnh quyết định độ phù hợp. Khi có số liệu độc lập, chúng đến từ Artificial Analysis; khi đến từ Meta hoặc Z.ai, chúng được gắn nhãn là do nhà cung cấp báo cáo; các con số về độ trễ và lưu lượng là dữ liệu telemetry sản xuất bảy ngày của chính OrcaRouter.

Đối chiếu thông số, từng chiều một.

Giá — Muse Spark 1.2 với $1,25 đầu vào / $4,25 đầu ra mỗi triệu token, $0,15 khi trúng cache; GLM 5.2 với $1,40 đầu vào / $4,40 đầu ra, $0,26 khi đã cache. Meta rẻ hơn ở mọi dòng.

Bối cảnh — cả hai đều có 1,048,576 token. Đầu ra tối đa: Meta ghi nhận mức trần 131,072 token cho Muse Spark 1.2; GLM 5.2 công bố 128,000.

Suy luận — suy luận là bắt buộc trên Muse Spark 1.2 ở năm cấp độ nỗ lực (từ tối thiểu đến xhigh, mặc định trung bình); GLM 5.2 chạy suy luận lai được kiểm soát bởi reasoning_effort ở mức cao hoặc tối đa, với suy luận sâu được bật theo mặc định.

Đầu vào — Muse Spark 1.2 quảng cáo hỗ trợ đầu vào văn bản, hình ảnh, video, âm thanh và PDF; GLM 5.2 chỉ nhận văn bản đầu vào và trả văn bản đầu ra.

Trọng số — Muse Spark 1.2 bị đóng, không có kho lưu trữ và không có đường dẫn tự lưu trữ; GLM 5.2 phát hành trọng số mở có giấy phép MIT, một mô hình Hỗn hợp Chuyên gia với 753B tham số, khoảng 40B hoạt động trên mỗi token.

Tuổi — Muse Spark 1.2 mới được ba ngày tuổi tính đến thời điểm viết bài; GLM 5.2 đã được đưa vào sản xuất từ ngày 13 tháng 6, với tám tuần kinh nghiệm thực tế và cả một hệ sinh thái máy chủ và công cụ được xây dựng xung quanh nó.

Khoảng cách chỉ số là bốn điểm. Cái bẫy phiên bản là có thật.

{{1}}Chỉ số Intelligence Index hiện tại của Artificial Analysis (v4.1.1) chấm Muse Spark 1.2 ở mức 57{{/1}}, xếp hạng #12/185, còn GLM 5.2 đạt 53 — điểm trọng số mở cao nhất trên bảng xếp hạng, nhưng vẫn kém 4 điểm. {{2}}Phần lớn các bài viết vẫn trích dẫn mức 54 cho Muse Spark 1.2 vì đó là kết quả đánh giá trong ngày ra mắt; bản chấm lại v4.1.1 đã cộng thêm 2,7 điểm cho mô hình này, mức tăng lớn nhất trong số các mô hình ở bản cập nhật đó.{{/2}} {{3}}Nếu bạn thấy "54 vs 51" hoặc "54 vs 53" ở đâu đó, hãy kiểm tra từng con số thuộc phiên bản chỉ số nào trước khi coi khoảng cách đó là thật.{{/3}}

Cần nói rõ khoảng cách bốn điểm có ý nghĩa gì và không có ý nghĩa gì. Nó có nghĩa là trên tổng hợp chín điểm chuẩn, mô hình đóng của Meta xếp trên mô hình mở của Z.ai với mức nỗ lực tương đương. Điều đó không có nghĩa là Muse Spark 1.2 vượt trội GLM 5.2 ở mọi thứ, vì hai mô hình đạt được điểm số của mình bằng những con đường khác nhau. GLM 5.2 là một ngoại lệ về toán học và lý luận — AIME 2026 đạt 99,2 — nhưng nó nổi tiếng là dài dòng và điểm yếu của nó là các công việc quy mô kho mã nguồn sâu. Muse Spark 1.2 có hình dạng ngược lại: mạnh về lập trình terminal và các tác vụ đa tệp, đồng thời chi phí đánh giá mỗi tác vụ rẻ hơn đáng kể, vì nó tiêu thụ ít token hơn nhiều trong quá trình suy luận.

A two-column scoreboard for Muse Spark 1.2 and GLM-5.2. AA Index (v4.1.1): 57 vs 53. Terminal-Bench 2.1: 80.1 vs 77.9. DeepSWE 1.1: 59.3 (Meta) vs 46.2. Weights: closed vs MIT open. Price in/out: $1.25/$4.25 vs $1.40/$4.40. p50 TTFT: 8.13 s vs 1.55 s.

Nơi các benchmark thực sự phân kỳ

Trên Terminal-Bench 2.1, hai mô hình này gần nhau hơn so với khoảng cách chỉ số thể hiện, và nguồn số liệu quan trọng hơn thường lệ. Trên cùng bộ đánh giá Artificial Analysis, Muse Spark 1.2 đạt 80.1 và GLM 5.2 đạt 77.9. Meta tuyên bố Muse Spark 1.2 đạt 82.9 trên bộ đánh giá riêng của họ; con số tốt nhất do Z.ai công bố cho GLM 5.2 là 82.7, qua đó đưa nó trở thành mô hình open-weight đầu tiên vượt mốc 80 trên benchmark đó. Cùng một benchmark, bốn con số khác nhau — việc ghép cặp bộ đánh giá làm điểm số dịch chuyển vài điểm theo cả hai hướng, vì vậy hãy coi mọi tuyên bố từ một terminal-bench duy nhất là một khoảng giá trị.

Sự khác biệt cần lưu ý là {{1}}DeepSWE 1.1{{/1}}, chuẩn đánh giá nhấn mạnh {{2}}suy luận sâu, đa tệp, quy mô kho lưu trữ trong một vòng lặp tác nhân dài{{/2}}. Meta báo cáo {{3}}59.3 cho Muse Spark 1.2{{/3}} — {{4}}con số từ phía nhà cung cấp, chưa bên thứ ba nào tái lập được{{/4}}. {{5}}GLM 5.2{{/5}} công bố điểm {{6}}DeepSWE{{/6}} là 46.2, và phiên bản tiền nhiệm {{7}}GLM-5.1{{/7}} đạt {{8}}18.0{{/8}}, vì vậy đây là khía cạnh Z.ai cải thiện nhiều nhất nhưng vẫn còn tụt hậu. Nếu khối lượng công việc của bạn là {{9}}"thay đổi năm mươi tệp một cách mạch lạc"{{/9}}, khoảng cách đó là toàn bộ câu chuyện; nếu khối lượng công việc của bạn là {{10}}lệnh terminal và scaffolding{{/10}}, nó gần như không đáng kể.

Một phát hiện nữa lật ngược cách nhìn hiển nhiên. Bộ đánh giá độc lập Vals AI, chuyên chạy các tác vụ agent theo từng lĩnh vực, xếp Muse Spark 1.2 ở vị trí thứ năm toàn cục với 71.88% — đồng thời đứng đầu ở Finance Agent, đứng đầu ở TaxEval, và đứng đầu trên benchmark Legal Agent của Harvey, lần lượt so với 44, 136 và 31 mô hình — trong khi Terminal-Bench 2.1 chỉ là lĩnh vực tốt thứ mười bốn của nó trong số năm mươi. Meta tiếp thị mô hình này như một công cụ viết mã, nhưng một nhà đánh giá độc lập phát hiện nó mạnh nhất ở các agent xử lý hồ sơ tài chính, thuế và pháp lý. Nếu nhóm của bạn soạn thảo hợp đồng hoặc đối soát sổ sách kế toán, đó là con số hữu ích nhất trong bài viết này.

Câu hỏi về trọng số mở mới thực sự là ngã rẽ.

Mọi điều nêu trên đều nói về năng lực. Quyết định chủ yếu xoay quanh quyền sở hữu, và ở điểm này, hai bên hoàn toàn trái ngược nhau.

GLM 5.2 là mô hình trọng số mở (open weights) được cấp phép MIT. Điều đó thay đổi cuộc thương lượng, không chỉ hóa đơn: bạn có thể tự lưu trữ nó nếu khối lượng công việc nhạy cảm hoặc lưu lượng lớn; bạn có thể chuyển nó giữa các nhà cung cấp mà không cần tích hợp lại, vì trọng số là của bạn; và bất kỳ nhà cung cấp nào định tuyến nó đều phải cạnh tranh về giá cả và độ trễ — đó là lý do dòng trọng số mở trở nên rẻ hơn theo thời gian. MoE 753B không phải là mô hình chạy trên laptop — hầu hết các đội ngũ vẫn sẽ thuê nó thay vì tự chạy — nhưng tùy chọn rời đi, hoặc chạy cùng các trọng số đó nội bộ với chi phí cố định, đặt một mức sàn cho những gì bất kỳ ai có thể tính phí bạn.

Muse Spark 1.2 chọn gói đối lập. Các trọng số bị đóng và con đường first-party duy nhất là Meta's Model API, mà giờ đây chúng tôi cũng định tuyến. Đổi lại, bạn nhận được một sản phẩm được đồng huấn luyện: Muse Code, tác tử terminal ra mắt cùng mô hình, được tinh chỉnh trên các quỹ đạo harness được lấy mẫu từ chối và chạy các tác tử con bền bỉ, an toàn khi khởi động lại trên runtime nhật ký sự kiện phát lại chính xác, với gói /plan, /grill/goal kỹ năng. Đó thực sự là một thứ khác biệt so với "một mô hình tốt bạn tự tích hợp vào harness của riêng mình" — nó là một agent hoạt động ngay khi được giao. Đánh đổi lại là nó chỉ hoạt động theo cách của Meta, trong công cụ của Meta, trên macOS hoặc Linux, chưa có client Windows, chưa có MCP và chưa có plugin IDE.

Screenshot of the Meta AI Research announcement 'Introducing Muse Code and Muse Spark 1.2', dated August 5 2026.

Giá mỗi token, giá mỗi tác vụ

Về giá mỗi token, Muse Spark 1.2 rẻ hơn ở cả đầu vào lẫn đầu ra, và chi phí mỗi tác vụ cũng thấp hơn vì đây cũng là mô hình ít dài dòng hơn. Artificial Analysis đo được GLM 5.2 tiêu tốn 141 triệu token đầu ra, 95% trong số đó là token suy luận, chỉ để chạy Intelligence Index tại thời điểm ra mắt — mô hình hàng đầu dài dòng nhất trên bảng xếp hạng. Muse Spark 1.2 tiêu tốn 95 triệu cho cùng bài tập đó với giá 0,40 USD mỗi tác vụ. Nhiều token hơn với mức giá cao hơn đồng nghĩa chi phí mỗi tác vụ của GLM 5.2 tăng lũy tiến theo cách mà giá niêm yết che giấu, và đây mới là cách đúng để so sánh các mô hình suy luận: định giá theo tác vụ hoàn thành, chứ không phải theo giá mỗi triệu token.

Có một mức giá thứ ba mà chỉ một trong các mô hình này có. Muse Spark 1.2 cung cấp gói đóng góp ở mức $0,10 cho đầu vào / $0,20 cho đầu ra — thấp hơn một bậc độ lớn so với gói tiêu chuẩn, và cũng thấp hơn giá niêm yết của GLM 5.2 với biên độ tương tự. Điều kiện để được truy cập là cho phép Meta huấn luyện các mô hình tương lai trên lưu lượng truy cập của bạn, cùng với giới hạn 60 yêu cầu mỗi phút khiến cho việc mở rộng trong môi trường sản xuất trở nên bất khả thi. Hãy coi đây là một bản đánh giá pháp lý kèm chiết khấu, không phải một mã sản phẩm rẻ hơn; đối với đội ngũ đủ điều kiện và hoạt động trong giới hạn này, nó khiến việc so sánh giá không còn là chuyện ngang ngửa nữa.

Độ trễ: hai mô hình đảo ngược

Nếu khoảng cách chỉ số nghiêng về Meta, thì hồ sơ độ trễ chính là nơi GLM 5.2 thắng thuyết phục về cảm giác. Trong bảy ngày qua của lưu lượng thực tế trên OrcaRouter, Muse Spark 1.2 cho thấy thời gian đến token đầu tiên ở p50 là 8.13 giây và p95 là 10.00 giây, sau đó bùng nổ với 576 token đầu ra mỗi giây và tỷ lệ lỗi bằng không. GLM 5.2 cho thấy p50 là 1.55 giây — nhanh hơn gấp hơn năm lần tới token đầu tiên — nhưng chỉ nhỏ giọt 78.5 token đầu ra mỗi giây với tỷ lệ lỗi 0.16%. Trong phòng thí nghiệm với nỗ lực tối đa, khoảng cách càng nới rộng: Artificial Analysis đo thời gian đến token đầu tiên của Muse Spark 1.2 là 26 giây ở mức xhigh, chế độ lập luận đắt đỏ nhất của nó.

Vậy một mô hình khiến bạn chờ đợi rồi mới trả kết quả nhanh; mô hình còn lại bắt đầu ngay lập tức nhưng lại mất thời gian. Đối với bất cứ điều gì mà con người đang theo dõi — một lượt trò chuyện, một phiên dòng lệnh tương tác — GLM 5.2 mang lại cảm giác tốt hơn, và đó là lý do nó chiếm ưu thế trong lưu lượng tương tác qua cổng kết nối của chúng tôi. Đối với một lần tạo sinh dài, một bản vá lớn hoặc một bản nháp tài liệu, Muse Spark 1.2 sẽ hoàn thành đầu tiên một khi nó bắt đầu, vì tốc độ xuất ra của nó gấp bảy lần GLM 5.2. Đo sai chỉ số và bạn sẽ chọn sai mô hình vì sai lý do.

Thử cả hai mà không cần hợp đồng thứ hai.

{{1}}Cả hai mô hình đều có trong danh mục OrcaRouter với giá niêm yết của nhà cung cấp{{/1}} — Muse Spark 1.2 ở mức $1.25 và $4.25, GLM 5.2 ở mức $1.40 và $4.40 — {{2}}vì OrcaRouter chuyển tiếp giá của nhà cung cấp với mức tăng 0%{{/2}}. {{3}}Điều đó khiến mức giá được tính theo hóa đơn thay vì theo giá dán nhãn, đồng nghĩa với việc chuyển đổi giữa hai mô hình chỉ là thay đổi một dòng trong chuỗi mô hình với cùng một khóa thay vì phải tích hợp mới{{/3}}. {{4}}Nếu nhà cung cấp giảm giá, mức giảm sẽ về phía chúng tôi ngay trong ngày{{/4}}.

Lớp định tuyến thực sự đáng giá ở đây chính vì hai mô hình này bổ trợ cho nhau. Điểm yếu của Muse Spark 1.2 là token đầu tiên phản hồi chậm và chi phí cao khi mở rộng quy mô; điểm yếu của GLM 5.2 là tính dài dòng và khả năng suy luận về kho mã nguồn sâu. Một quy tắc định tuyến gửi bước lập kế hoạch tới Muse Spark 1.2 và phân tán các worker song song tới GLM 5.2 — hoặc chuyển sang GLM 5.2 khi endpoint của Muse Code chậm — không tốn thêm chi phí xây dựng, vì cả hai đều nằm sau một endpoint duy nhất. Và với một mô hình mới ra mắt ba ngày, chuyển đổi dự phòng tự động chính là cách bạn dùng thử nó mà không cần đặt cược cả một luồng production vào nó.

Screenshot of the OrcaRouter model page for GLM-5.2 (z-ai/glm-5.2), showing $1.40 per million input tokens, a 1M-token context window, 128K max output and an OpenAI-compatible endpoint.

Ai nên chọn cái nào

Chọn Muse Spark 1.2 khi đơn vị công việc là một tạo phẩm lớn, mạch lạc và ai đó có thể chờ vài giây để nó khởi động: tái cấu trúc đa tệp, tạo toàn bộ kho lưu trữ, vòng lặp tác nhân dài, và — theo Vals AI — công việc xử lý tài chính, thuế và văn bản pháp lý. Lead DeepSWE, tỷ lệ đầu ra cao và hạng mức đóng góp đều chỉ về cùng một hướng. Bạn đang chấp nhận trọng số đóng, công cụ của Meta và token đầu tiên chậm hơn, và bạn nên đọc 82.9 và 59.3 của Meta như những tuyên bố, không phải sự thật.

Chọn GLM 5.2khi quyền sở hữu và cảm nhận quan trọng hơn chỉ số tổng hợp: trọng số mở bạn có thể tự lưu trữ hoặc di chuyển, token đầu tiên nhanh cho công việc tương tác, hệ sinh thái các bộ khung và công cụ vốn đã hỗ trợ nó, và năng lực tổng quát mạnh nhất hiện có ở dạng trọng số mở. Hãy chấp nhận sự dài dòng, chỉ số DeepSWE 46.2, và mức giá niêm yết cao hơn trên mỗi token ngay cả trước khi tính đến chênh lệch về số lượng token.

Hầu hết các nhóm sẽ nhận ra rằng câu trả lời trung thực không phải là chỉ một trong hai. Mô hình mở là con ngựa thồ mà bạn định tuyến phần lớn lưu lượng qua; mô hình đóng là chuyên gia bạn hướng đến cho các tác vụ sâu và các tài liệu nhạy cảm. Cách nhau bốn điểm trên một chỉ số tổng hợp, nhưng khác biệt một trời một vực về việc ai sở hữu trọng số — đó chính là sự lựa chọn, và nó rõ ràng hơn nhiều so với các điểm số.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube