Muse Spark 1.2 và Muse Code-1
Guides & Insights

Muse Spark 1.2 và Muse Code: Mô hình thứ ba của Meta trong bốn tháng hòa với Grok 4.5

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Meta đã phát hành Muse Spark 1.2 vào ngày 5 tháng 8 năm 2026, bốn tuần sau Muse Spark 1.1 và khoảng bốn tháng sau Muse Spark đầu tiên. Phiên bản này ra mắt với một thứ mà hai phiên bản trước không có: một tác nhân lập trình của riêng Meta, Muse Code, được phát hành ở bản beta và được huấn luyện chung với mô hình mà nó chạy trên. Và trên bảng xếp hạng duy nhất mà cả Meta lẫn các đối thủ đều không kiểm soát, bản phát hành này đưa Meta vào thế song mã với SpaceXAI — Muse Spark 1.2 và Grok 4.5 hiện đều đạt 54 điểm trên Artificial Analysis Intelligence Index. Năm ngày sau, một diễn biến lớn hơn đã đến: vào ngày 10 tháng 8, Meta cho biết sẽ mở trọng số của Muse Spark 1.2 — một thông báo mà nếu thành hiện thực, sẽ đưa mô hình này trở thành đối thủ mở trọng số mạnh nhất hiện nay của Mỹ so với các mô hình Trung Quốc.

Hai điều cần tách bạch trước khi bất kỳ con số nào dưới đây có ý nghĩa. Điểm Intelligence Index, các số liệu về độ trễ và số token đến từ Artificial Analysis, tổ chức này tự chạy các bài đánh giá riêng và công bố chi phí; những con số đó là độc lập. Các kết quả lập trình mà Meta mở đầu thông báo của mình — Terminal-Bench 2.1, DeepSWE v1.1 và một điểm chuẩn nội bộ — do Meta chạy, trên bộ khung thử nghiệm của Meta, với mỗi mô hình cạnh tranh được ghép với sản phẩm agent riêng của nó. Cả hai loại con số đều hữu ích. Chúng không phải cùng một loại bằng chứng, và bài viết này giữ chúng tách biệt.

Những gì Meta thực sự đã phát hành

Muse Spark 1.2 and Muse Code-2

Thông báo đăng trên blog nghiên cứu AI của Meta, đề ngày 5 tháng 8, đề cập đến hai sản phẩm cùng lúc.

Muse Spark 1.2 — bản cập nhật tập trung vào mã nguồn của dòng Muse Spark. Meta cho biết họ đã tăng quy mô tính toán huấn luyện cho các tác vụ lập trình và đa dạng hóa môi trường huấn luyện, đồng thời vẫn giữ được khả năng tác tử tổng quát vốn là điểm bán chính của bản phát hành 1.1. Các mục tiêu huấn luyện được công bố đều mang tính dài hạn: tạo toàn bộ kho mã nguồn, các dự án end-to-end lớn, và thứ Meta gọi là nghiên cứu tự động, với việc lập kế hoạch để sắp xếp trình tự công việc, điều kiện hóa mục tiêu để giữ vững hướng đi qua nhiều bước, và nén ngữ cảnh để duy trì trạng thái liên quan khi phiên chạy kéo dài.

Muse Code — một tác tử lập trình chạy trên terminal, đang trong giai đoạn beta, được cài đặt bằng một tập lệnh shell một dòng từ tên miền dành cho nhà phát triển của Meta. Nó chạy các tác tử nền bất đồng bộ liên tục, tồn tại qua nhiều phiên làm việc, trên một runtime nhật ký sự kiện cục bộ mà Meta mô tả là tái hiện chính xác và an toàn khi khởi động lại, đồng thời nó điều phối nhiều tác tử con cho mỗi tác vụ trong các cây làm việc biệt lập. Nó đi kèm với ba kỹ năng tích hợp sẵn: /plan để lập kế hoạch cần được phê duyệt, /grill để kiểm tra áp lực công việc đã hoàn thành, và /goal để dẫn dắt một tác vụ đi đến hoàn thành.

Việc ghép cặp này không phải ngẫu nhiên. Meta cho biết hai bên được đồng huấn luyện — mô hình được tinh chỉnh trên các quỹ đạo lấy mẫu loại trừ từ bộ khung, với các tối ưu hóa công thức cho mục tiêu, nén và tác nhân con. Đây cũng chính là cách đồng huấn luyện đã tạo ra Claude Code và Codex, và nó có một hệ quả với bất kỳ ai đọc số liệu benchmark: điểm mã hóa nổi bật của mô hình được tạo ra bên trong bộ khung mà nó được huấn luyện. Đó không phải gian lận — đó là cách đánh giá tác nhân vận hành hiện nay. Nhưng điều đó cũng có nghĩa là điểm 1.2 đạt được qua một bộ khung khác là một câu hỏi mở, chứ không phải một giả định an toàn.

Phần còn lại của spec không thay đổi so với 1.1, vốn bản thân nó chỉ mang tính tham khảo. Kích thước ngữ cảnh vẫn ở mức 1.048.576 token. Chế độ suy luận vẫn là bắt buộc ở cả năm mức nỗ lực — minimal, low, medium, high, xhigh — với medium là mặc định; không tồn tại cấu hình nào cho phép bạn có được trọng số mà không phải trả phí cho một phần suy luận. Tại thời điểm ra mắt, các trọng số không được công khai, không có kho lưu trữ trên Hugging Face, và Model API của chính Meta là nơi first-party duy nhất để gọi model. Việc này hiện đã được lên kế hoạch sẽ thay đổi: vào ngày 10 tháng 8, Meta đã thông báo sẽ mở công khai các trọng số, đảo ngược chính sách trọng số đóng vốn chi phối ba bản phát hành Muse Spark đầu tiên.

43, rồi 51, rồi 54

Muse Spark 1.2 and Muse Code-3

Artificial Analysis chấm điểm {{1}}Muse Spark 1.2{{/1}} ở mức 54 trên {{2}}Chỉ số Trí tuệ{{/2}} của mình ở cài đặt suy luận xhigh, xếp hạng nó ở vị trí #13 trong số 185 mô hình so với mức trung vị của nhóm là 32. Chỉ số này là tổng hợp có trọng số của chín bài đánh giá — {{3}}GDPval-AA v2{{/3}}, {{4}}τ³-Banking{{/4}}, {{5}}Terminal-Bench v2.1{{/5}}, {{6}}SciCode{{/6}}, {{7}}Humanity's Last Exam{{/7}}, {{8}}GPQA Diamond{{/8}}, {{9}}CritPt{{/9}}, AA-Omniscience và AA-LCR — được chia đều cho tác nhân, lập trình, năng lực tổng quát và suy luận khoa học.

Đọc như một chuỗi thay vì một bức ảnh chụp nhanh, quỹ đạo của Meta mới là câu chuyện thực sự. Bản gốc Muse Spark đạt 43 điểm vào tháng 4. Muse Spark 1.1 đạt 51 vào ngày 9 tháng 7, tăng tám điểm trong một quý. Muse Spark 1.2 tăng thêm ba điểm trong vòng chưa đầy một tháng. Meta đã tăng 11 điểm chỉ số trong bốn tháng và hiện đang phát hành nhanh hơn mức hệ sinh thái đánh giá có thể theo kịp — vẫn chưa có bảng phân tích theo từng benchmark nào được công bố cho 1.2, và cũng không có bản ghi nào trên Design Arena cho phiên bản này, trong khi 1.1 có cả hai.

Ở mức 54, Meta ngang hàng với Grok 4.5 – mô hình mà SpaceXAI tung ra một ngày trước Muse Spark 1.1 – và xếp sau một nhóm tiên phong cạnh tranh sát sao: Claude Opus 5 đạt 61, Claude Fable 5 đạt 60, GPT-5.6 Sol đạt 59. Khoảng cách lên đỉnh là sáu hoặc bảy điểm. Khoảng cách so với thời điểm Meta bắt đầu năm là mười một. Liệu khoảng cách đó có được thu hẹp hay không phụ thuộc vào việc nhịp độ phát hành có được duy trì, và hiện Meta đang chạy theo chu kỳ phát hành bốn tuần.

Tuy nhiên, hòa trên chỉ số tổng hợp không đồng nghĩa với hòa trên từng công việc cụ thể, và cần nói rõ con số 54 giải quyết được điều gì và không giải quyết điều gì. Nó khẳng định rằng Muse Spark 1.2 thuộc cùng nhóm thảo luận với Grok 4.5 về năng lực tổng thể. Nó không cho bạn biết cái nào viết bản vá tốt hơn, vì chỉ số phụ về lập trình có thể trả lời câu hỏi đó vẫn chưa được công bố cho phiên bản 1.2.

Các con số mã hóa của Meta, hãy đọc kỹ.

Thông báo của Meta dẫn đầu trên ba biểu đồ. Trong các lần chạy của chính nó, được báo cáo là pass@1 qua năm lần thử nghiệm với mỗi mô hình cạnh tranh được ghép với sản phẩm đại lý của riêng nó:

Terminal-Bench 2.1 — 82.9% cho Muse Spark 1.2, tăng từ 76.2% của phiên bản 1.1. Claude Opus 5 được xếp trước với 86.7%.

DeepSWE v1.1 — 59.3%, tăng từ 53.0%.

Chuẩn đánh giá lập trình nội bộ của Meta — 70,6%, tăng từ 68,3%.

Các mức chênh lệch là phần đáng tin cậy. Mức tăng 6,7 điểm trên Terminal-Bench và 6,3 trên DeepSWE, được đo cùng một cách trên cùng một bộ khung bởi cùng một nhóm, cách nhau một tháng, là một cách đọc hợp lý về mức độ cải thiện của 1.2 so với 1.1 ở điều mà Meta đang tối ưu hóa. Thứ hạng chéo giữa các nhà cung cấp là phần không nên đặt quá nặng: việc ghép bộ khung là một biến số tự do lớn, và một phòng thí nghiệm tinh chỉnh bộ khung của riêng mình cùng với mô hình của mình thì không ở vị thế để tinh chỉnh bộ khung của người khác một cách tốt tương đương. Meta đứng thứ hai trên chính slide của mình, điều này ít nhất không phải là hình dạng thông thường của một benchmark do nhà cung cấp đưa ra, nhưng tính đến thời điểm viết bài này, vẫn chưa có bên thứ ba nào tái tạo lại được bất kỳ kết quả nào trong số đó.

Bảng giá thứ hai

Điều hệ trọng nhất trong bản phát hành này không nằm trên các biểu đồ đo hiệu năng. Muse Spark 1.2 đi kèm hai bảng giá.

Gói tiêu chuẩn — $1.25 cho mỗi triệu token đầu vào, $0.15 cho mỗi triệu khi trúng bộ nhớ đệm, $4.25 cho mỗi triệu token đầu ra. Không thay đổi so với phiên bản 1.1, chính xác đến từng xu. Giới hạn tốc độ khoảng 3,000 yêu cầu mỗi phút. Web-search grounding được tính phí riêng ở mức $2.50 cho mỗi nghìn truy vấn.

Hạng người đóng góp — 0,10 USD cho đầu vào, 0,002 USD cho đầu vào được lưu trong bộ nhớ đệm, 0,20 USD cho đầu ra. Rẻ hơn 12,5 lần cho đầu vào và rẻ hơn 21,25 lần cho đầu ra. Cái giá phải trả là cho phép Meta huấn luyện các mô hình tương lai trên lưu lượng truy cập của bạn, cùng với giới hạn tốc độ 60 yêu cầu mỗi phút — tức 2% ngân sách tiêu chuẩn.

Ở mức $0,10 và $0,20, Muse Spark 1.2 sẽ rẻ hơn gần như mọi mô hình tiệm cận tiên phong trên thị trường, kể cả phân khúc ngân sách trọng số mở mà nó thua về giá ở các khía cạnh khác. Đó là con số đáng chú ý trong lần ra mắt này, và nó thực sự không phải là một quyết định định giá. Sáu mươi yêu cầu mỗi phút tự nó đã loại bỏ hầu hết các mẫu fan-out trong sản xuất, vì vậy phân khúc này nhắm đến việc thử nghiệm và công việc nhóm nhỏ thay vì phục vụ sản xuất. Và "chúng tôi có thể huấn luyện trên lưu lượng truy cập của bạn" là câu hỏi dành cho người phê duyệt quản trị dữ liệu trong tổ chức của bạn, không phải cho người chọn mô hình. Hãy coi nó như một đợt rà soát pháp lý kèm chiết khấu, không phải một mã SKU rẻ hơn.

Chi phí để sản xuất 54 là bao nhiêu?

Muse Spark 1.2 and Muse Code-4

Artificial Analysis công bố chi phí chạy đánh giá của chính mình, và cột đó chính là nơi hình dáng của Muse Spark 1.2 lộ diện. Hoàn thành bộ chín bài đánh giá tiêu tốn $637.85 và ngốn 95 triệu token đầu ra, so với $548.07 và 94 triệu cho Muse Spark 1.1 — với mức giá trên mỗi token giống hệt nhau. Phần 16% dư ra hoàn toàn là do suy luận.

Các chỉ số độ trễ cũng diễn biến theo cùng một hướng. Đo tại xhigh, thời gian đến token đầu tiên là 26,12 giây cho 1.2 so với 2,90 giây cho 1.1, và tốc độ đầu ra giảm từ 213,5 xuống 165,0 token mỗi giây. Meta đã mua ba điểm chỉ số bằng thời gian suy nghĩ, và thiết kế suy luận bắt buộc nghĩa là bạn không thể từ chối giao dịch mua — chỉ có thể chọn mức độ mình thực hiện.

Con số 26 giây đó sẽ bị trích dẫn sai, nên tôi đính chính trước: đó là phép đo ở mức nỗ lực đắt nhất mà mô hình cung cấp, còn API mặc định ở mức trung bình. Là một điểm tham chiếu từ lưu lượng thực tế thay vì từ bộ đo điểm chuẩn, Muse Spark 1.1 được phục vụ qua OrcaRouter — ở bất kỳ mức nỗ lực nào mà người gọi thực sự yêu cầu — cho thấy thời gian đến token đầu tiên p50 trong 7 ngày là 1,84 giây và p95 là 6,00 giây, với 519 token mỗi giây và tỷ lệ lỗi bằng không. Độ trễ điểm chuẩn ở mức nỗ lực tối đa và độ trễ sản xuất ở mức nỗ lực mặc định là những đại lượng khác nhau, và chúng thường chênh lệch một bậc độ lớn. Hãy coi 26,12 giây là mức trần cho suy luận sâu, chứ không phải là cảm nhận mà một yêu cầu sẽ mang lại.

Nơi bạn có thể gọi ngay hôm nay

Muse Spark 1.2 được phục vụ bởi Model API của chính Meta và, tính đến thời điểm viết bài này, không nơi nào khác — vẫn chưa có kho lưu trữ Hugging Face và nó cũng không có trong danh mục OrcaRouter. Đó là điều mà thông báo ngày 10 tháng 8 dự kiến sẽ thay đổi: Meta cho biết các trọng số sẽ được mở 'trong những tuần tới', và một khi điều đó xảy ra, câu hỏi về khả năng sẵn có sẽ chuyển từ 'nó được phục vụ ở đâu?' sang 'trọng số nào, theo giấy phép nào, và trong môi trường chạy nào'. Muse Spark 1.1 có trong danh mục OrcaRouter, với giá $1.25 và $4.25 — cùng con số mà Meta tính phí, vì OrcaRouter lấy 0% phí chênh lệch và chuyển thẳng giá niêm yết của nhà cung cấp.

Điều đó quan trọng đối với việc so sánh nhiều hơn là đối với bản thân mô hình. Nếu bạn đang xây dựng một mô hình chi phí cho bản phát hành này, các mô hình bạn sẽ đem ra benchmark với nó — Claude Opus 5, Claude Fable 5, GPT-5.6 Sol, Grok 4.5, DeepSeek V4 Flash — đều truy cập qua một khóa API duy nhất với giá niêm yết, nên con số trong bảng tính của bạn cũng chính là con số trên hóa đơn, và việc nhà cung cấp giảm giá có hiệu lực ngay trong ngày thay vì phải chờ đến kỳ gia hạn. Đối với riêng Muse Spark 1.2, hiện tại câu trả lời là endpoint của Meta, một hợp đồng thứ hai và một hóa đơn riêng biệt — và một khi các trọng số được phát hành, việc tự cài đặt (self-hosted install) sẽ trở thành lựa chọn thứ ba.

Ngày 10 tháng 8 đã có gì thay đổi?

Năm ngày sau khi phát hành, thái độ của Meta đối với sản phẩm chủ lực của chính mình đã thay đổi hoàn toàn. Trong một thông báo ngày 10 tháng 8, Meta cho biết sẽ mở trọng số của Muse Spark 1.2 "trong những tuần tới", biến đây thành bản phát hành Muse Spark đầu tiên mà một đội ngũ có thể tự vận hành. Tuyên bố này mới chỉ là lời công bố từ lãnh đạo, chưa được phát hành chính thức: vẫn chưa có kho lưu trữ Hugging Face nào, và ngày cụ thể, số tham số cũng như giấy phép đều chưa được xác nhận.

Cốt lõi là cuộc đua trọng số tiên phong. Muse Spark 1.2 đạt 54 điểm trên Chỉ số Trí tuệ Phân tích Nhân tạo (Artificial Analysis Intelligence Index) — cao hơn mọi mô hình trọng số mở của Mỹ hiện có thể tải xuống — nên nếu trọng số được phát hành đúng như cam kết, đây sẽ là đối thủ trọng số mở mạnh nhất của Mỹ cạnh tranh với các phòng thí nghiệm Trung Quốc, đúng theo cách Zuckerberg đã lập luận dài dòng vào ngày 10 tháng 8 trong một bài tiểu luận dài 6.500 chữ, cáo buộc các hạn chế của Mỹ đối với dữ liệu huấn luyện đã trao lợi thế dẫn đầu về trọng số mở cho các phòng thí nghiệm nước ngoài. Bước ngoặt này đã có sản phẩm đầu tiên: Muse Glimmer, một mô hình 30 tỷ tham số được phát hành cùng ngày theo giấy phép Apache 2.0, được chưng cất từ Muse Spark và xây dựng cho các khối lượng công việc tác tử cục bộ. Các tiêu chuẩn đánh giá của riêng Meta xếp mô hình này vượt trội Google Gemma4-31B và Qwen3.6-27B trong các tác vụ tác tử; những con số đó do nhà cung cấp tự chạy và đến nay vẫn chưa được kiểm chứng độc lập.

Điều mà thông báo không trả lời

Không có chỉ số lập trình độc lập nào. Artificial Analysis công bố chỉ số tổng hợp cho 1.2 nhưng chưa công bố các chỉ số phụ về lập trình và agentic mà họ từng công bố cho 1.1 (lần lượt là 71.3 và 37.5). Vì khả năng agentic là khía cạnh yếu nhất của 1.1 với cách biệt lớn, và lập trình agentic chính là thứ mà 1.2 tuyên bố đã khắc phục, nên đây là con số sẽ quyết định bản phát hành này.

Không có bản sao kết quả thử nghiệm. Mọi số liệu mã hóa trong thông báo đều do Meta chạy. Chưa ai công bố điểm số Muse Spark 1.2 từ một khung trung lập.

Không có xác minh đa phương thức.Danh sách Muse Spark quảng cáo đầu vào văn bản, hình ảnh, video, âm thanh và PDF. Đánh giá độc lập bao gồm văn bản và hình ảnh. Thông điệp 1.2 của Meta gần như đã chuyển hoàn toàn sang công việc phần mềm, và trường hợp sử dụng đa phương tiện 1.1 được bán rõ ràng cho hiện tại lại không có cả tiếp thị lẫn đo lường đằng sau nó.

Không có lịch sử thông lượng. Lưu lượng trên endpoint vẫn quá thấp để các số liệu thống kê độ trễ trượt thông thường được cập nhật.

Những gì cần xem trong bốn tuần tới

Bốn điều sẽ quyết định liệu bản phát hành này có đúng như những gì Meta tuyên bố hay không. Điều thứ nhất là {{1}}điểm số tác nhân độc lập cho phiên bản 1.2{{/1}} — nếu chỉ số phụ từng đạt 37.5 trên 1.1 đã thay đổi đáng kể, thì tuyên bố về năng lực mã hóa là có thật. Điều thứ hai là {{2}}liệu có ai tái lập được kết quả Terminal-Bench bên ngoài Muse Code{{/2}}; một mô hình chỉ hoạt động tốt bên trong bộ khung kiểm thử của riêng mình là một sản phẩm, không phải một năng lực. Điều thứ ba là {{3}}điều gì sẽ xảy ra với hạng đóng góp{{/3}}: nếu trần 60 yêu cầu được nới lỏng, một mô hình gần trình độ tiên phong với giá $0.10 đầu vào và $0.20 đầu ra sẽ thay đổi phép tính của hạng ngân sách theo cách mà mức tăng ba điểm trong chỉ số không bao giờ làm được. Điều thứ tư là {{4}}cam kết về trọng số{{/4}}: Meta cho biết trọng số của Muse Spark 1.2 sẽ được mở 'trong những tuần tới', và liệu kho mã nguồn có ra mắt đúng tiến độ đó hay không — theo giấy phép nào và các môi trường chạy cục bộ tiếp nhận nhanh đến đâu — sẽ quyết định liệu bước chuyển sang trọng số mở có thật hay không.

Và nếu nhịp độ được giữ vững, Muse Spark 1.3 dự kiến ra mắt vào đầu tháng 9. Dựa trên bằng chứng này, con số cần theo dõi khi nó ra mắt không phải là điểm chỉ số. Mà là liệu Meta có thể bổ sung khả năng mà không thêm hai mươi giây suy nghĩ vào đầu mỗi yêu cầu hay không. Thành quả đầu tiên của sự chuyển hướng đó đã có mặt: Muse Glimmer, một mô hình trọng số mở 30 tỷ tham số mà Meta phát hành vào ngày 10 tháng 8 theo giấy phép Apache 2.0, được xây dựng để chạy các tác nhân cục bộ — bản xem trước gần nhất về diện mạo của một Muse Spark 1.2 mở.

So sánh trong bài viết này3

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày