Muse Code
Guides & Insights

Muse Code: Meta ra mắt một agent lập trình thất bại trên chính benchmark của mình

Tác giả

Jim Song

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Các nhà cung cấp thường không công bố bảng xếp hạng mà họ đứng thứ hai. Meta đã công bố ba bảng như vậy. Trong bộ tài liệu ra mắt Muse Code — tác nhân lập trình đầu cuối do Meta Superintelligence Labs phát hành vào ngày 5 tháng 8 năm 2026, chạy trên phiên bản cùng ngày Muse Spark 1.2Claude Opus 5 dẫn đầu trên mọi bảng xếp hạng mà Meta chọn trưng bày, bao gồm cả bảng do chính Meta xây dựng và kiểm soát. Trên Terminal-Bench 2.1, khoảng cách là 3.8 điểm. Trên DeepSWE 1.1 là 5.7, với GPT-5.6 Terra cũng xếp trên. Trên benchmark nội bộ của Meta, khoảng cách là 8.8. Phiên bản lan truyền của đợt ra mắt này — "59% trên DeepSWE 1.1, vượt qua Grok 4.5Gemini 3.6 Flash" — là sự thật, và đó là phát biểu đúng nhất theo nghĩa hẹp nhất hiện có.

Điều đó làm cho buổi ra mắt trở nên thú vị hơn, chứ không kém đi. Meta đã phát hành một bộ benchmark mà họ không thắng, và vẫn phát hành nó, bởi vì điểm số không phải thứ họ đang bán. Thứ họ đang bán là một runtime có thể trụ được qua một tác vụ 24 giờ, và một cái giá rẻ hơn đối thủ hơn một bậc độ lớn — miễn là bạn sẵn lòng để Meta đọc kho lưu trữ mã của bạn. Mọi con số benchmark dưới đây đều lấy từ biểu đồ của chính Meta, được công bố mà không kèm phương pháp luận; nơi nào có đo lường độc lập, câu văn sẽ nói rõ điều đó.

Những gì Meta thực sự đã phát hành

Hai việc trong cùng một ngày, được cố ý gắn kết với nhau.

Muse Code — tác nhân lập trình trong terminal, bản beta công khai, cài đặt chỉ với một dòng lệnh: curl -fsSL https://dev.meta.ai/install.sh | bash. Chỉ hỗ trợ macOS và Linux; không có bản dựng Windows gốc, không có giao diện đồ họa và không có tiện ích mở rộng IDE. Meta mô tả công việc của nó là đảm nhận kỹ thuật phần mềm phức tạp trên các kho mã lớn — lập kế hoạch thay đổi, viết mã, xác thực kết quả.

Muse Spark 1.2 — một bản sửa đổi tập trung vào lập trình của mô hình suy luận Meta, ngữ cảnh 1.048.576 token, có sẵn trong Muse Code và thông qua Meta Model API ở bản xem trước công khai. Meta cho biết họ đã tăng quy mô tính toán huấn luyện cho các tác vụ lập trình và đa dạng hóa môi trường huấn luyện, với mục tiêu hướng đến các công việc dài hạn: tạo toàn bộ kho mã nguồn, tái cấu trúc nhiều tệp, gỡ lỗi kéo dài.

Sự gắn kết chính là trọng tâm của tuyên bố. Meta cho biết hai mô hình được huấn luyện chung, và do đó sự kết hợp này tạo ra "khả năng sử dụng công cụ tốt hơn, ít lần thử lại hơn và đầu ra chất lượng cao hơn so với một trình bao bọc thông thường quanh một mô hình bên ngoài." Đó là cách diễn đạt và khẳng định của Meta; chưa có bên thứ ba nào thử nghiệm mô hình trong một khung tích hợp đối thủ để kiểm tra xem lợi ích từ việc huấn luyện chung có thực sự tồn tại hay không, hay liệu Muse Spark 1.2 chỉ đơn giản hoạt động như một mô hình viết mã có năng lực dù được đặt ở bất kỳ đâu.

Ba kỹ năng đi kèm với tác nhân, và chúng mô tả phong cách làm việc dự kiến rõ ràng hơn cả nội dung tiếp thị: /plan tạo ra một kế hoạch cần phê duyệt trước khi bất cứ điều gì được viết ra, /grill thử thách kế hoạch đó, và /goal thúc đẩy hoàn thành một mục tiêu đã nêu. Lập kế hoạch, tấn công kế hoạch, rồi thực thi — đó là quy trình mà những người dùng kỳ cựu của Claude Code và Codex đã cùng hội tụ về theo cách thủ công, nay được phát hành như các lệnh hạng nhất.

Bộ trình chiếu chuẩn, được đọc một cách trung thực.

Muse Code

Meta đã công bố các bài so sánh trên Terminal-Bench 2.1, DeepSWE 1.1, Meta Internal Coding Bench của chính mình và GDPval. Các con số, theo như Meta báo cáo:

Terminal-Bench 2.1 — Claude Opus 5 với nỗ lực tối đa trong Claude Code đạt 86,7%, Muse Spark 1.2 trong Muse Code đạt 82,9%, GPT-5.6 Terra trong Codex đạt 81,8%, Grok 4.5 trong Grok Build đạt 81,6%. Hạng nhì, và từ hạng nhì đến hạng tư cách nhau 1,3 điểm.

DeepSWE 1.1 — Claude Opus 5 65.0%, GPT-5.6 Terra 64.8%, Muse Spark 1.2 59.3%. Đứng thứ ba, và là bảng duy nhất mà khoảng cách mang tính quyết định chứ không chỉ mang tính hình thức.

Meta Internal Coding Bench — Claude Opus 5 79.4%, Muse Spark 1.2 70.6%. Sân nhà của Meta, và cũng là thất bại đậm nhất của Meta.

Qua từng thế hệ — Meta báo cáo +6.7 điểm trên Terminal-Bench và +6.3 trên DeepSWE so với Muse Spark 1.1. Đây là những con số lớn nhất trong bộ tài liệu và là những con số mà người dùng Muse Spark 1.1 thực sự nên quan tâm.

Một trục trặc số học đáng được nêu tên, vì đó là lý do để xem tất cả những điều trên chỉ mang tính định hướng. Nếu loại trừ mức +6.7 của Meta, Muse Spark 1.1 đạt gần 76% trên Terminal-Bench 2.1 — nhưng bảng xếp hạng công khai tbench.ai đã hiển thị mức 80.0% được xác minh cho Muse Spark 1.1 từ cuối tháng Bảy. Cả hai con số đều có thể trung thực mà vẫn mâu thuẫn nhau, vì một hàng trên Terminal-Bench không phải là điểm số của mô hình. Đó là điểm số của một bộ khung (harness) cộng với một mô hình cộng với một cấu hình nỗ lực, và bộ khung nội bộ của Meta cho 1.1 không phải là bộ khung mà tbench đã chạy. Chỉ riêng sự thật đó đã gây nhiều tổn hại cho việc so sánh điểm chuẩn giữa các nhà cung cấp hơn bất kỳ con số gây tranh cãi riêng lẻ nào, và nó dẫn trực tiếp đến phần tiếp theo.

Runtime chính là sản phẩm.

Muse Code

Bỏ đi phần điểm số, thứ còn lại là một bài thuyết trình kỹ thuật về việc không chết. Hai cơ chế đảm bảo điều đó.

Đầu tiên là nhật ký sự kiện. Muse Code ghi thêm mọi lời gọi mô hình, mọi lần chạy công cụ, mọi phê duyệt và mọi chỉnh sửa vào một nhật ký cục bộ, thứ mà Meta mô tả là giúp phiên làm việc có thể phát lại chính xác và an toàn khi khởi động lại: giết nó, làm nó sập, mất cả máy, và agent sẽ tiếp tục chính xác từ điểm dừng thay vì phải dựng lại ngữ cảnh từ đầu. Các đối thủ có khả năng khôi phục sau sự cố với chất lượng khác nhau; không ai trong số họ biến nó thành điểm nhấn. Nhân tiện, nó cũng là một bằng chứng kiểm toán — một bản ghi cục bộ đầy đủ về những gì một quy trình tự động đã làm với cây thư mục làm việc của bạn, chính xác là tài liệu mà một cuộc rà soát bảo mật yêu cầu và hầu hết CLI agent không thể tạo ra.

Thứ hai là thứ Meta gọi là các tác tử nền không đồng bộ. Điểm khác biệt so với các tác tử phụ thông thường là chúng không được sinh ra cho từng tác vụ con rồi bị hủy bỏ; chúng tồn tại suốt phiên làm việc, tự mình thực hiện các bước tiếp theo và chọn thời điểm báo cáo lại cho vòng lặp chính. Lợi ích được khẳng định là độ trễ thấp hơn, vì bộ điều phối không phải trả chi phí khởi động mỗi lần ủy quyền.

Bằng chứng hỗ trợ của Meta là một nghiên cứu điển hình: {{1}}Muse Code chạy trong 24 giờ qua hơn 1.000 lần gọi công cụ, tự động tối ưu hóa nhân GPU trên phần cứng NVIDIA Hopper{{/1}}, với những cải thiện mà Meta gọi là đáng kể so với bản triển khai cơ sở được cung cấp. Không có con số tăng tốc nào được công bố, vì vậy điều đáng quan tâm không phải là kết quả mà là thời lượng. {{2}}Một nghìn lần gọi công cụ không có sự cứu hộ của con người là một bề mặt lỗi khác với một lần tái cấu trúc chỉ với năm mươi lần gọi{{/2}}, và đó là một khối lượng công việc mà mức thiếu hụt 3,8 điểm benchmark ít quan trọng hơn nhiều so với việc tiến trình còn sống ở giờ thứ chín hay không.

Giá cả là vũ khí — và một phần của nó được trả bằng mã nguồn

Không có gói đăng ký Muse Code. Việc thanh toán bằng token, thuộc một trong hai hạng mức, và khoảng cách giữa hai hạng mức này là điểm quyết liệt nhất trong đợt ra mắt lần này.

Standard — 1,25 USD cho mỗi triệu token đầu vào, 0,15 USD cho mỗi triệu token đầu vào được lưu cache, 4,25 USD cho mỗi triệu token đầu ra. Các prompt ở gói này không được sử dụng để cải thiện sản phẩm của Meta.

Người đóng góp — $0.10 cho mỗi triệu token đầu vào, $0.002 cho mỗi triệu token đầu vào được lưu trong bộ nhớ đệm, $0.20 cho mỗi triệu token đầu ra. Đổi lại, Meta có thể sử dụng dữ liệu để cải thiện các mô hình của mình.

Rẻ hơn 12,5 lần cho đầu vào, rẻ hơn 21 lần cho đầu ra và rẻ hơn 75 lần cho đầu vào được lưu cache. Đưa nó qua một bước agent thực tế — 60.000 token ngữ cảnh repository đầu vào, 3.000 token plan-and-patch đầu ra — và bốn góc của bảng giá thật sự đáng kinh ngạc. Gói tiêu chuẩn với prompt nguội: 8,8 xu mỗi bước, 87,75 đô la cho một nghìn bước. Gói tiêu chuẩn với ngữ cảnh repository trúng cache: 2,2 xu, 21,75 đô la mỗi nghìn bước. Gói cộng tác viên với cache nguội: 0,66 xu, 6,60 đô la mỗi nghìn bước. Gói cộng tác viên với cache ấm: 0,72 đô la cho cùng một nghìn bước.

Cùng một khối lượng công việc, với chi phí gấp 122 lần hoặc chỉ bằng 1/122, tùy thuộc vào hai lựa chọn. Phiên chạy kernel 24 giờ, 1.000 cuộc gọi của chính Meta tiêu tốn khoảng chín mươi đô la token ở gói bảo vệ dữ liệu của bạn, và dưới một đô la ở gói không bảo vệ.

Đây mới là quyết định thực sự mà đợt ra mắt này đặt trước các nhóm, và nó không phải là quyết định về giá cả. {{1}}Một tác nhân lập trình thiết bị đầu cuối đọc codebase của bạn — đó chính là toàn bộ chức năng của nó — vì vậy các prompt trong gói đóng góp chứa mã nguồn, API nội bộ, các bình luận về lý do tại sao giải pháp tạm thời tồn tại, và bất kỳ dữ liệu kiểm thử nào kho lưu trữ của bạn đang nắm giữ.{{/1}} {{2}}Đối với dự án phụ hoặc cây mã nguồn mở, gói đóng góp gần như là tiền miễn phí. Đối với codebase độc quyền, hoặc bất kỳ kho lưu trữ nào có thể chạm tới dữ liệu khách hàng, đây là quyết định cấp phép được ngụy trang dưới vỏ bọc chiết khấu, và nó thuộc về người phê duyệt cách xử lý dữ liệu chứ không phải người theo dõi hóa đơn điện toán đám mây.{{/2}} {{3}}Meta định giá nó với mức chiết khấu 12 lần vì dữ liệu đó đáng giá ít nhất ngần ấy đối với Meta.{{/3}}

Những gì bạn không thể lấy thông qua API

Muse Code

82,9% thuộc về Muse Spark 1.2 bên trong Muse Code. Nếu bạn gọi mô hình từ khung tác nhân của riêng mình, bạn đã mua phần mô hình của cặp kết hợp đó mà không có phần khung — không có nhật ký sự kiện, không có tác nhân nền thường trực, và, nếu tuyên bố đồng huấn luyện của Meta có ý nghĩa gì, thì cũng không có hành vi sử dụng công cụ được tinh chỉnh nào. Vì vậy, có hai đánh giá riêng biệt ở đây và gộp chúng lại là sai lầm dễ mắc nhất trong tuần này: liệu Muse Code có đánh bại tác nhân bạn đang chạy hay không, và liệu Muse Spark 1.2 có phải là mô hình tốt hơn mô hình bạn hiện đang gọi hay không?

Câu hỏi thứ hai là câu ít tốn kém hơn để trả lời, vì nó chỉ cần giữ nguyên khung thử nghiệm của bạn và hoán đổi mô hình bên dưới nó. Cần nói rõ về tính khả dụng: Muse Spark 1.2 do Meta trực tiếp cung cấp và không có trong danh mục OrcaRouter. Muse Spark 1.1 có giá 1,25 đô la và 4,25 đô la — đúng bằng giá niêm yết của Meta, vì OrcaRouter không cộng thêm bất kỳ khoản phụ giá nào và chuyển thẳng giá của nhà cung cấp, đó cũng là lý do mà thay đổi giá của nhà cung cấp xuất hiện ở phía chúng tôi ngay trong ngày nó xảy ra chứ không phải sau một chu kỳ hợp đồng. Dữ liệu vận hành sản xuất trong bảy ngày của chúng tôi cho phiên bản 1.1 cho thấy p50 thời gian đến token đầu tiên là 1,84 giây và p95 là 6,00 giây, đây là kỳ vọng độ trễ hữu ích hơn bất kỳ kỳ vọng độ trễ nào mà một khung điểm chuẩn có thể mang lại cho bạn.

Giá trị thực tiễn của một gateway duy nhất trong một tuần như thế này là bộ so sánh — {{1}}Claude Opus 5, GPT-5.6 Terra, Grok 4.5, Gemini 3.6 Flash và Muse Spark 1.1{{/1}} — chỉ đứng sau một khóa ở mức giá niêm yết, nên một phép thử A/B chỉ là thay đổi chuỗi chứ không phải một quy trình mua sắm. Nó cũng giải quyết rủi ro cấu trúc trong đề xuất của Meta: {{2}}Muse Spark 1.2 chỉ có đúng một nhà cung cấp, khiến nó trở thành điểm lỗi đơn lẻ ngay từ thiết kế{{/2}}. Cơ chế chuyển đổi dự phòng tự động giữa các nhà cung cấp chính là thứ tạo nên khác biệt giữa việc một buổi chiều tồi tệ của Meta có trở thành buổi chiều tồi tệ của agent của bạn hay không.

Đây cũng là lý do tại sao 1.2 được phát hành một cách âm thầm và chậm chạp

Muse Spark 1.2 xuất hiện trên API của Meta vào ngày 5 tháng 8 mà không có thông báo nào, cũng không có con số nào thay đổi — vẫn 1M ngữ cảnh, vẫn $1,25 và $4,25, vẫn năm mức suy luận giống Muse Spark 1.1. Điều duy nhất thay đổi được đo từ bên ngoài: Artificial Analysis ghi nhận thời gian đến token đầu tiên là 26,12 giây so với 2,90 giây của phiên bản 1.1 ở mức suy luận tối đa, đổi lấy ba điểm trên Chỉ số Trí tuệ, từ 51 lên 54. Nếu xem như một bản phát hành mô hình đa dụng, đây là một sự đánh đổi kỳ lạ — chờ lâu gấp chín lần chỉ để có thêm ba điểm.

Được đọc như nửa mô hình của một tác nhân được huấn luyện chung, đó là sự đánh đổi hiển nhiên. Không ai đang chờ đợi một đợt tái cấu trúc mười hai tệp lại để ý đến hai mươi sáu giây lập kế hoạch; người đang chờ một lượt hoàn thành chat lại để ý đến toàn bộ. Meta không âm thầm phát hành một mô hình chat và hy vọng không ai đo độ trễ. Họ đang giao động cơ trước khi có xe, và thông báo đến khi chiếc xe cũng đến. Trang nhà phát triển Muse Spark của Meta hiện cũng hiển thị 1.2.

Hệ quả là một lời cảnh báo cho bất kỳ ai đã chọn dòng sản phẩm này vì độ phủ rộng của nó. Muse Spark 1.1 từng được bán như một mô hình lý luận đa phương thức — văn bản, hình ảnh, video, âm thanh và PDF, phù hợp cho nghiên cứu đa phương tiện. Định vị của phiên bản 1.2 là công việc phần mềm, và tài liệu ra mắt của nó là một tác nhân lập trình. Bề mặt đa phương thức chưa bị loại bỏ, nhưng nó không còn là thứ Meta đang tối ưu hóa hay quảng cáo, và chưa ai bên ngoài Meta công bố kết quả video hoặc âm thanh cho bản 1.2.

Nơi Muse Code vẫn còn mỏng

Nó là bản beta, và được gắn nhãn như vậy. Chưa có ai bên ngoài Meta xác minh bất kỳ điều gì về cam kết nhật ký sự kiện.

Chỉ hỗ trợ macOS và Linux. Các nhà phát triển Windows phải dùng WSL hoặc không có gì, điều này là một ràng buộc thực sự đối với các hệ thống doanh nghiệp chứ không chỉ là một sự bất tiện.

Chỉ dành cho terminal.Không có GUI, không tích hợp IDE, và không có tác nhân song song lưu trữ trên đám mây như loại Codex đã cung cấp. Tài liệu ra mắt của Meta không đề cập đến hỗ trợ MCP.

Không có phương pháp luận được công bố đằng sau bất kỳ biểu đồ điểm chuẩn nào, và chưa có đánh giá độc lập nào về cả tác nhân lẫn điểm thành phần mã hóa của Muse Spark 1.2. Artificial Analysis có chỉ số tổng hợp cho 1.2 nhưng không có bảng phân tích theo từng điểm chuẩn về mã hóa và tác nhân mà họ công bố cho 1.1 — và điểm tác nhân của 1.1 là khía cạnh yếu nhất với cách biệt lớn, điều đó khiến nó chính xác là con số có thể quyết định bản phát hành này.

Meta đến muộn.Claude Code và Codex đã có một năm hình thành thói quen, hệ sinh thái plugin và quy trình làm việc nhóm được xây dựng xung quanh chúng. Nhật ký sự kiện an toàn trước sự cố là một lý do chính đáng để thử điều gì đó; bản thân nó không phải là lý do để chuyển một nhóm.

Những câu hỏi mà mọi người thực sự đang hỏi

Muse Code có miễn phí không?

Không, nhưng cũng không có đăng ký định kỳ nào cả — không giống như các gói Claude Code và Codex mà nó cạnh tranh, Muse Code tính phí hoàn toàn theo token thông qua Meta Model API. Do đó, chi phí phụ thuộc vào lượng ngữ cảnh kho lưu trữ mà các phiên của bạn đẩy vào, chứ không phải theo số lượng người dùng, điều này có lợi cho những người dùng nặng thi thoảng và bất lợi cho các tác nhân luôn hoạt động. Hạng mức cộng tác viên đủ gần với miễn phí đến mức giá không phải là rào cản thực sự để dùng thử.

Hạng đóng góp có huấn luyện trên mã riêng tư của tôi không?

Các điều khoản của Meta cho bậc đó là dữ liệu có thể được dùng để cải thiện mô hình của họ, và lời nhắc của tác nhân mã hóa chứa mã của bạn. Meta tuyên bố rằng lời nhắc ở bậc tiêu chuẩn không được dùng để cải thiện sản phẩm của họ; đó là bậc nên dùng cho mọi thứ độc quyền. Hãy coi lựa chọn này là một quyết định xử lý dữ liệu kèm chiết khấu, không phải sở thích thanh toán — và lưu ý rằng chiết khấu áp dụng theo từng token, nên động cơ âm thầm hạ cấp tăng lên đúng theo mức sử dụng của bạn.

Tôi có thể sử dụng Muse Spark 1.2 với Claude Code hoặc agent của riêng tôi không?

Mô hình này có sẵn thông qua Meta Model API độc lập với Muse Code, nên là có, cho bất kỳ thứ gì hỗ trợ endpoint tùy chỉnh. Điều bạn sẽ không có được là sự kết hợp đồng huấn luyện mà Meta ghi nhận cho các kết quả benchmark của nó, và kỳ vọng thực tế là một mô hình chạy bên ngoài harness mà nó được tinh chỉnh sẽ đạt điểm dưới con số trên biểu đồ. Nếu mục tiêu là đánh giá mô hình thay vì agent, hãy chạy nó so với Claude Opus 5 và GPT-5.6 Terra trong harness của riêng bạn và bỏ qua hoàn toàn bài trình bày.

Ai nên cài đặt nó trong tuần này

Nếu bạn chạy các tác vụ tự động dài hạn — di chuyển dữ liệu, nâng cấp phụ thuộc trong một monorepo, bất cứ điều gì mà hiện tại bạn phải theo dõi sát sao vì tác nhân bị mất vị trí — Muse Code đáng để dành một buổi chiều trên một bản sao thử nghiệm. Nhật ký sự kiện và các tác nhân nền liên tục nhằm chính xác vào điểm lỗi đó, và mức thiếu hụt điểm chuẩn là nhỏ nhất khi thời lượng tác vụ dài nhất.

Nếu bạn đang làm việc trên một mã nguồn mở hoặc mã nguồn không nhạy cảm và chi phí là ràng buộc chính của bạn, gói contributor là con số thú vị nhất trên thị trường coding agent hiện nay, và 0,66 xu mỗi bước không phải là lỗi đánh máy.

Nếu bạn đang vận hành một đội ngũ trên Claude Code hoặc Codex làm việc với kho mã nguồn độc quyền, thì hiện chưa có gì ở đây để buộc phải chuyển đổi. Muse Code đứng thứ hai hoặc thứ ba trên mọi bảng xếp hạng mà chính nhà cung cấp của nó lựa chọn, giá của gói tiêu chuẩn chỉ ngang bằng mặt bằng chung thay vì thấp hơn, và điểm khác biệt nằm ở một đặc tính độ tin cậy mà chưa ai ngoài Meta thử nghiệm. Điều cần theo dõi không phải là benchmark tiếp theo. Mà là liệu event log có trụ vững khi một người không làm việc tại Meta chạy một nghìn lời gọi công cụ qua nó.

So sánh trong bài viết này3

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

Liên hệ với chúng tôi

Tham gia cộng đồng

DiscordEmailXGitHubYouTube