
Muse Spark 1.2 và Muse Code: Mô hình thứ ba của Meta trong bốn tháng hòa với Grok 4.5
- metaMỚIMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenMỚIQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekMỚIDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- qwenMỚIQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token · 188 tok/s
- orcaMỚIOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicMỚIAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Trí tuệ77Lập trình
- grokxAI: Grok 4.52026-07-0856Trí tuệ72Lập trình
- tencentTencent: Hy32026-07-0642Trí tuệ59Lập trình
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Trí tuệ42Lập trình
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Trí tuệ39Lập trình
- anthropicAnthropic: Claude Sonnet 52026-06-3055Trí tuệ72Lập trình
- klingKling: Kling 3.0 Turbo2026-06-1757Trí tuệ52Lập trình57Toán
- z-aiZ.ai: GLM 5.22026-06-1653Trí tuệ69Lập trình60Toán
Meta đã phát hành Muse Spark 1.2 vào ngày 5 tháng 8 năm 2026, bốn tuần sau Muse Spark 1.1 và khoảng bốn tháng sau Muse Spark đầu tiên. Phiên bản này ra mắt với một thứ mà hai phiên bản trước không có: một tác nhân lập trình của riêng Meta, Muse Code, được phát hành dưới dạng beta và được đào tạo cùng với mô hình mà nó chạy trên đó. Và trên bảng xếp hạng duy nhất mà cả Meta lẫn các đối thủ đều không kiểm soát, bản phát hành này đưa Meta vào thế song mã với SpaceXAI — Muse Spark 1.2 và Grok 4.5 hiện đều đạt 54 điểm trên Artificial Analysis Intelligence Index.
Hai điều cần tách bạch trước khi bất kỳ con số nào dưới đây có ý nghĩa. Điểm Intelligence Index, các số liệu về độ trễ và số token đến từ Artificial Analysis, tổ chức này tự chạy các bài đánh giá riêng và công bố chi phí; những con số đó là độc lập. Các kết quả lập trình mà Meta mở đầu thông báo của mình — Terminal-Bench 2.1, DeepSWE v1.1 và một điểm chuẩn nội bộ — do Meta chạy, trên bộ khung thử nghiệm của Meta, với mỗi mô hình cạnh tranh được ghép với sản phẩm agent riêng của nó. Cả hai loại con số đều hữu ích. Chúng không phải cùng một loại bằng chứng, và bài viết này giữ chúng tách biệt.
Những gì Meta thực sự đã phát hành

Thông báo đăng trên blog nghiên cứu AI của Meta, đề ngày 5 tháng 8, đề cập đến hai sản phẩm cùng lúc.
• Muse Spark 1.2 — bản cập nhật tập trung vào mã nguồn của dòng Muse Spark. Meta cho biết họ đã tăng quy mô tính toán huấn luyện cho các tác vụ lập trình và đa dạng hóa môi trường huấn luyện, đồng thời vẫn giữ được khả năng tác tử tổng quát vốn là điểm bán chính của bản phát hành 1.1. Các mục tiêu huấn luyện được công bố đều mang tính dài hạn: tạo toàn bộ kho mã nguồn, các dự án end-to-end lớn, và thứ Meta gọi là nghiên cứu tự động, với việc lập kế hoạch để sắp xếp trình tự công việc, điều kiện hóa mục tiêu để giữ vững hướng đi qua nhiều bước, và nén ngữ cảnh để duy trì trạng thái liên quan khi phiên chạy kéo dài.
• Muse Code — một tác tử lập trình chạy trên terminal, đang trong giai đoạn beta, được cài đặt bằng một tập lệnh shell một dòng từ tên miền dành cho nhà phát triển của Meta. Nó chạy các tác tử nền bất đồng bộ liên tục, tồn tại qua nhiều phiên làm việc, trên một runtime nhật ký sự kiện cục bộ mà Meta mô tả là tái hiện chính xác và an toàn khi khởi động lại, đồng thời nó điều phối nhiều tác tử con cho mỗi tác vụ trong các cây làm việc biệt lập. Nó đi kèm với ba kỹ năng tích hợp sẵn: /plan để lập kế hoạch cần được phê duyệt, /grill để kiểm tra áp lực công việc đã hoàn thành, và /goal để dẫn dắt một tác vụ đi đến hoàn thành.
Việc ghép cặp này không phải ngẫu nhiên. Meta cho biết hai bên được đồng huấn luyện — mô hình được tinh chỉnh trên các quỹ đạo lấy mẫu loại trừ từ bộ khung, với các tối ưu hóa công thức cho mục tiêu, nén và tác nhân con. Đây cũng chính là cách đồng huấn luyện đã tạo ra Claude Code và Codex, và nó có một hệ quả với bất kỳ ai đọc số liệu benchmark: điểm mã hóa nổi bật của mô hình được tạo ra bên trong bộ khung mà nó được huấn luyện. Đó không phải gian lận — đó là cách đánh giá tác nhân vận hành hiện nay. Nhưng điều đó cũng có nghĩa là điểm 1.2 đạt được qua một bộ khung khác là một câu hỏi mở, chứ không phải một giả định an toàn.
Phần còn lại của đặc tả không thay đổi so với 1.1, vốn bản thân nó cũng chỉ mang tính tham khảo. Ngữ cảnh vẫn giữ ở mức 1,048,576 token. Suy luận vẫn là bắt buộc ở cả năm mức độ nỗ lực — minimal, low, medium, high, xhigh — với medium là mặc định; không có cấu hình nào cho phép bạn nhận được trọng số mà không phải bỏ ra một chút suy luận. Các trọng số được đóng, không có kho lưu trữ Hugging Face, và Model API của riêng Meta vẫn là nơi bên thứ nhất duy nhất để gọi nó.
43, rồi 51, rồi 54

Artificial Analysis chấm điểm {{1}}Muse Spark 1.2{{/1}} ở mức 54 trên {{2}}Chỉ số Trí tuệ{{/2}} của mình ở cài đặt suy luận xhigh, xếp hạng nó ở vị trí #13 trong số 185 mô hình so với mức trung vị của nhóm là 32. Chỉ số này là tổng hợp có trọng số của chín bài đánh giá — {{3}}GDPval-AA v2{{/3}}, {{4}}τ³-Banking{{/4}}, {{5}}Terminal-Bench v2.1{{/5}}, {{6}}SciCode{{/6}}, {{7}}Humanity's Last Exam{{/7}}, {{8}}GPQA Diamond{{/8}}, {{9}}CritPt{{/9}}, AA-Omniscience và AA-LCR — được chia đều cho tác nhân, lập trình, năng lực tổng quát và suy luận khoa học.
Đọc như một chuỗi thay vì một bức ảnh chụp nhanh, quỹ đạo của Meta mới là câu chuyện thực sự. Bản gốc Muse Spark đạt 43 điểm vào tháng 4. Muse Spark 1.1 đạt 51 vào ngày 9 tháng 7, tăng tám điểm trong một quý. Muse Spark 1.2 tăng thêm ba điểm trong vòng chưa đầy một tháng. Meta đã tăng 11 điểm chỉ số trong bốn tháng và hiện đang phát hành nhanh hơn mức hệ sinh thái đánh giá có thể theo kịp — vẫn chưa có bảng phân tích theo từng benchmark nào được công bố cho 1.2, và cũng không có bản ghi nào trên Design Arena cho phiên bản này, trong khi 1.1 có cả hai.
Ở mức 54, Meta ngang hàng với Grok 4.5 – mô hình mà SpaceXAI tung ra một ngày trước Muse Spark 1.1 – và xếp sau một nhóm tiên phong cạnh tranh sát sao: Claude Opus 5 đạt 61, Claude Fable 5 đạt 60, GPT-5.6 Sol đạt 59. Khoảng cách lên đỉnh là sáu hoặc bảy điểm. Khoảng cách so với thời điểm Meta bắt đầu năm là mười một. Liệu khoảng cách đó có được thu hẹp hay không phụ thuộc vào việc nhịp độ phát hành có được duy trì, và hiện Meta đang chạy theo chu kỳ phát hành bốn tuần.
Tuy nhiên, hòa trên chỉ số tổng hợp không đồng nghĩa với hòa trên từng công việc cụ thể, và cần nói rõ con số 54 giải quyết được điều gì và không giải quyết điều gì. Nó khẳng định rằng Muse Spark 1.2 thuộc cùng nhóm thảo luận với Grok 4.5 về năng lực tổng thể. Nó không cho bạn biết cái nào viết bản vá tốt hơn, vì chỉ số phụ về lập trình có thể trả lời câu hỏi đó vẫn chưa được công bố cho phiên bản 1.2.
Các con số mã hóa của Meta, hãy đọc kỹ.
Thông báo của Meta dẫn đầu trên ba biểu đồ. Trong các lần chạy của chính nó, được báo cáo là pass@1 qua năm lần thử nghiệm với mỗi mô hình cạnh tranh được ghép với sản phẩm đại lý của riêng nó:
• Terminal-Bench 2.1 — 82.9% cho Muse Spark 1.2, tăng từ 76.2% của phiên bản 1.1. Claude Opus 5 được xếp trước với 86.7%.
• DeepSWE v1.1 — 59.3%, tăng từ 53.0%.
• Chuẩn đánh giá lập trình nội bộ của Meta — 70,6%, tăng từ 68,3%.
Các mức chênh lệch là phần đáng tin cậy. Mức tăng 6,7 điểm trên Terminal-Bench và 6,3 trên DeepSWE, được đo cùng một cách trên cùng một bộ khung bởi cùng một nhóm, cách nhau một tháng, là một cách đọc hợp lý về mức độ cải thiện của 1.2 so với 1.1 ở điều mà Meta đang tối ưu hóa. Thứ hạng chéo giữa các nhà cung cấp là phần không nên đặt quá nặng: việc ghép bộ khung là một biến số tự do lớn, và một phòng thí nghiệm tinh chỉnh bộ khung của riêng mình cùng với mô hình của mình thì không ở vị thế để tinh chỉnh bộ khung của người khác một cách tốt tương đương. Meta đứng thứ hai trên chính slide của mình, điều này ít nhất không phải là hình dạng thông thường của một benchmark do nhà cung cấp đưa ra, nhưng tính đến thời điểm viết bài này, vẫn chưa có bên thứ ba nào tái tạo lại được bất kỳ kết quả nào trong số đó.
Bảng giá thứ hai
Điều hệ trọng nhất trong bản phát hành này không nằm trên các biểu đồ đo hiệu năng. Muse Spark 1.2 đi kèm hai bảng giá.
• Gói tiêu chuẩn — $1.25 cho mỗi triệu token đầu vào, $0.15 cho mỗi triệu khi trúng bộ nhớ đệm, $4.25 cho mỗi triệu token đầu ra. Không thay đổi so với phiên bản 1.1, chính xác đến từng xu. Giới hạn tốc độ khoảng 3,000 yêu cầu mỗi phút. Web-search grounding được tính phí riêng ở mức $2.50 cho mỗi nghìn truy vấn.
• Hạng người đóng góp — 0,10 USD cho đầu vào, 0,002 USD cho đầu vào được lưu trong bộ nhớ đệm, 0,20 USD cho đầu ra. Rẻ hơn 12,5 lần cho đầu vào và rẻ hơn 21,25 lần cho đầu ra. Cái giá phải trả là cho phép Meta huấn luyện các mô hình tương lai trên lưu lượng truy cập của bạn, cùng với giới hạn tốc độ 60 yêu cầu mỗi phút — tức 2% ngân sách tiêu chuẩn.
Ở mức $0,10 và $0,20, Muse Spark 1.2 sẽ rẻ hơn gần như mọi mô hình tiệm cận tiên phong trên thị trường, kể cả phân khúc ngân sách trọng số mở mà nó thua về giá ở các khía cạnh khác. Đó là con số đáng chú ý trong lần ra mắt này, và nó thực sự không phải là một quyết định định giá. Sáu mươi yêu cầu mỗi phút tự nó đã loại bỏ hầu hết các mẫu fan-out trong sản xuất, vì vậy phân khúc này nhắm đến việc thử nghiệm và công việc nhóm nhỏ thay vì phục vụ sản xuất. Và "chúng tôi có thể huấn luyện trên lưu lượng truy cập của bạn" là câu hỏi dành cho người phê duyệt quản trị dữ liệu trong tổ chức của bạn, không phải cho người chọn mô hình. Hãy coi nó như một đợt rà soát pháp lý kèm chiết khấu, không phải một mã SKU rẻ hơn.
Chi phí để sản xuất 54 là bao nhiêu?

Artificial Analysis công bố chi phí chạy đánh giá của chính mình, và cột đó chính là nơi hình dáng của Muse Spark 1.2 lộ diện. Hoàn thành bộ chín bài đánh giá tiêu tốn $637.85 và ngốn 95 triệu token đầu ra, so với $548.07 và 94 triệu cho Muse Spark 1.1 — với mức giá trên mỗi token giống hệt nhau. Phần 16% dư ra hoàn toàn là do suy luận.
Các chỉ số độ trễ cũng diễn biến theo cùng một hướng. Đo tại xhigh, thời gian đến token đầu tiên là 26,12 giây cho 1.2 so với 2,90 giây cho 1.1, và tốc độ đầu ra giảm từ 213,5 xuống 165,0 token mỗi giây. Meta đã mua ba điểm chỉ số bằng thời gian suy nghĩ, và thiết kế suy luận bắt buộc nghĩa là bạn không thể từ chối giao dịch mua — chỉ có thể chọn mức độ mình thực hiện.
Con số 26 giây đó sẽ bị trích dẫn sai, nên tôi đính chính trước: đó là phép đo ở mức nỗ lực đắt nhất mà mô hình cung cấp, còn API mặc định ở mức trung bình. Là một điểm tham chiếu từ lưu lượng thực tế thay vì từ bộ đo điểm chuẩn, Muse Spark 1.1 được phục vụ qua OrcaRouter — ở bất kỳ mức nỗ lực nào mà người gọi thực sự yêu cầu — cho thấy thời gian đến token đầu tiên p50 trong 7 ngày là 1,84 giây và p95 là 6,00 giây, với 519 token mỗi giây và tỷ lệ lỗi bằng không. Độ trễ điểm chuẩn ở mức nỗ lực tối đa và độ trễ sản xuất ở mức nỗ lực mặc định là những đại lượng khác nhau, và chúng thường chênh lệch một bậc độ lớn. Hãy coi 26,12 giây là mức trần cho suy luận sâu, chứ không phải là cảm nhận mà một yêu cầu sẽ mang lại.
Nơi bạn có thể gọi ngay hôm nay
Muse Spark 1.2 được phục vụ bởi Model API của chính Meta và, tại thời điểm viết bài, không nơi nào khác — nó không được định tuyến trên OpenRouter khi ra mắt, không có kho lưu trữ Hugging Face, và không có trong danh mục OrcaRouter. Muse Spark 1.1 có giá $1.25 và $4.25 — cùng mức giá Meta tính phí, vì OrcaRouter không tính phí chênh lệch (0% markup) và chuyển thẳng giá niêm yết của nhà cung cấp.
Điều đó quan trọng với việc so sánh hơn là với bản thân mô hình. Nếu bạn đang xây dựng mô hình chi phí cho bản phát hành này, các mô hình bạn dùng để benchmark — Claude Opus 5, Claude Fable 5, GPT-5.6 Sol, Grok 4.5, DeepSeek V4 Flash — đều dùng chung một khóa truy cập theo giá niêm yết, nên con số trên bảng tính của bạn chính là con số trên hóa đơn, và việc nhà cung cấp hạ giá sẽ có hiệu lực ngay trong ngày thay vì chỉ sau khi gia hạn. Riêng với Muse Spark 1.2, câu trả lời hiện nay là endpoint của Meta, một hợp đồng thứ hai, và một hóa đơn riêng.
Điều mà thông báo không trả lời
• Không có chỉ số lập trình độc lập nào. Artificial Analysis công bố chỉ số tổng hợp cho 1.2 nhưng chưa công bố các chỉ số phụ về lập trình và agentic mà họ từng công bố cho 1.1 (lần lượt là 71.3 và 37.5). Vì khả năng agentic là khía cạnh yếu nhất của 1.1 với cách biệt lớn, và lập trình agentic chính là thứ mà 1.2 tuyên bố đã khắc phục, nên đây là con số sẽ quyết định bản phát hành này.
• Không có bản sao kết quả thử nghiệm. Mọi số liệu mã hóa trong thông báo đều do Meta chạy. Chưa ai công bố điểm số Muse Spark 1.2 từ một khung trung lập.
• Không có xác minh đa phương thức.Danh sách Muse Spark quảng cáo đầu vào văn bản, hình ảnh, video, âm thanh và PDF. Đánh giá độc lập bao gồm văn bản và hình ảnh. Thông điệp 1.2 của Meta gần như đã chuyển hoàn toàn sang công việc phần mềm, và trường hợp sử dụng đa phương tiện 1.1 được bán rõ ràng cho hiện tại lại không có cả tiếp thị lẫn đo lường đằng sau nó.
• Không có lịch sử thông lượng. Lưu lượng trên endpoint vẫn quá thấp để các số liệu thống kê độ trễ trượt thông thường được cập nhật.
Những gì cần xem trong bốn tuần tới
Có ba điều sẽ quyết định liệu bản phát hành này có đúng như những gì Meta tuyên bố hay không. Điều đầu tiên là điểm số agentic độc lập cho phiên bản 1.2 — nếu chỉ số phụ từng đạt 37.5 trên phiên bản 1.1 đã dịch chuyển đáng kể, thì lời khẳng định về năng lực lập trình là có thật. Điều thứ hai là liệu có ai tái lập được kết quả Terminal-Bench bên ngoài Muse Code hay không; một mô hình chỉ hoạt động tốt trong bộ khung của chính nó thì là một sản phẩm, chứ không phải một năng lực. Điều thứ ba là điều gì sẽ xảy ra với hạng đóng góp: nếu giới hạn 60 yêu cầu được nới lỏng, một mô hình gần chạm ngưỡng tiên phong với giá $0.10 đầu vào và $0.20 đầu ra sẽ làm thay đổi phép tính của hạng ngân sách theo cách mà mức tăng ba điểm chỉ số không bao giờ làm được.
Và nếu nhịp độ vẫn được giữ vững, Muse Spark 1.3 sẽ ra mắt vào đầu tháng Chín. Dựa trên bằng chứng này, con số cần theo dõi khi nó ra mắt không phải là điểm chỉ số. Mà là liệu Meta có thể bổ sung khả năng mà không thêm thêm hai mươi giây suy nghĩ vào đầu mỗi yêu cầu hay không.
So sánh trong bài viết này3
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
