Thẻ tiêu đề chính (hero title card) cho tin tức rằng Muse Spark 1.3 với chế độ suy luận tối đa (max reasoning) đã chính thức ra mắt. Overline: 'Meta Superintelligence Labs — 4 tháng 9, 2026'; headline: 'Muse Spark 1.3 với chế độ suy luận tối đa (max reasoning) đã chính thức ra mắt'; phụ đề ghi rõ Meta đã hoàn tất kiểm định an toàn hai ngày sau khi ra mắt và mở chế độ suy luận tạo nên các điểm số nổi bật trong Muse Code và Meta Model API với cùng mức giá; các badge: 'mức độ suy luận: max', 'vẫn giữ giá niêm yết $1.25 / $4.25' và 'cấu hình đứng sau DeepSWE 75.4'; chân trang: 'Hiện có thể chọn trên muse-spark-1.3 — token suy luận được tính phí như token đầu ra'; logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

Muse Spark 1.3 Max Reasoning đã chính thức ra mắt: Cài đặt tạo nên điểm số cao nhất của Meta giờ đã có mặt cho tất cả mọi người.

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Muse Spark 1.3 — mô hình suy luận tiên phong do Meta Superintelligence Labs phát hành vào ngày 2 tháng 9 — vừa có được chế độ mà bảng điểm của chính nó được xây dựng dựa trên. Vào ngày 4 tháng 9, sau hai ngày kiểm tra an toàn bổ sung, Meta đã mở cài đặt suy luận "max" có mức tiêu tốn tính toán nhiều nhất của mô hình cho các nhà phát triển trên Meta Model API và trong Muse Code, tác tử mã hóa đầu cuối của họ. Giám đốc AI Alexandr Wang đã công bố việc triển khai trên X và tài khoản @AIatMeta của công ty đã xác nhận điều này; điều mà khi ra mắt chỉ là cấu hình giới hạn cho Meta và bản xem trước dành cho đối tác, giờ đây đã trở thành mức suy luận mà bất kỳ nhà phát triển nào cũng có thể lựa chọn.

Trình tự đó rất quan trọng vì một số con số chi phối các bài đưa tin về sự ra mắt của Muse Spark 1.3 — 75,4 trên DeepSWE v1.1, 66,9 trên OSWorld 2.0, 1.754 trên GDPval-AA v2 — đến từ cấu hình max, trong khi mô hình mà các nhà phát triển thực sự có thể gọi được lại được phát hành với reasoning effort bị giới hạn ở mức "xhigh". Meta đã nói rõ ngay khi ra mắt rằng max vẫn đang trong quá trình kiểm tra an toàn, nhưng sự tách biệt này có nghĩa là bảng điểm nổi bật và mô hình có thể gọi được là hai thứ khác nhau trong suốt hai ngày. Bản phát hành hôm thứ Năm đã xóa bỏ khoảng cách đó mà không hề đụng đến giá mỗi token. Các con số benchmark trong danh sách đó là do chính Meta công bố và vẫn chưa được một hệ thống đánh giá độc lập nào tái tạo lại; mọi số liệu do nhà cung cấp báo cáo trong bài viết này đều được ghi chú rõ ràng như vậy.

Điều gì đã bị giữ lại — và điều gì đã thay đổi vào ngày 4 tháng 9

Bậc suy luận của Muse Spark 1.3 vẫn giữ nguyên hình dạng kể từ khi API trả phí của dòng sản phẩm này được mở: suy luận luôn bật và tham số nỗ lực của mô hình trên Meta Model API nhận các giá trị minimal, low, medium, high và xhigh, với mô hình dành nhiều ngân sách đầu ra hơn để suy nghĩ khi mức độ tăng lên. Max nằm trên xhigh — nhiều tính toán hơn, nhiều token suy luận hơn và theo lời Meta, mạnh hơn đáng kể trong các công việc tự chủ tầm xa. Tại sự kiện ra mắt ngày 2 tháng 9, Meta đã phát hành mọi mức lên đến xhigh nhưng giữ max ngoài API công khai với lý do cần thêm các bài kiểm tra an toàn mà họ gọi là "kiểm thử an toàn bổ sung", chỉ chia sẻ mức này với một nhóm đối tác hạn chế — đủ để một đánh giá độc lập chạy được, nhưng không đủ cho một khối lượng công việc sản xuất thực tế.

Vào ngày 4 tháng 9, Wang cho biết việc thử nghiệm đã hoàn tất. Max hiện là một tùy chọn có thể chọn trong Muse Code — script cài đặt nằm tại dev.meta.ai/install.sh — và trên mã mô hình muse-spark-1.3 thông qua Meta Model API, nơi tham số effort hiện chấp nhận giá trị max. Wang mô tả việc kéo dài hai ngày là cách Meta kiểm soát truy cập "ở cấp cấu hình," và nói với Axios rằng Meta đã không phải tạm dừng công việc lớn hơn của mình vì các lo ngại về an toàn. Khoảng thời gian này ngắn, nhưng nó là một tiền lệ thực sự: Meta hiện sẵn sàng giữ một chế độ suy luận cụ thể sau quy trình rà soát an toàn trong khi phát hành ngay phần còn lại của một checkpoint.

Một lưu ý thực tế cho những ai gọi mô hình qua gateway thay vì endpoint riêng của Meta: một số trang tài liệu và danh sách tổng hợp từ bên thứ ba được viết vào ngày ra mắt vẫn chỉ liệt kê reasoning effort đến mức xhigh. Giá trị max nằm trong đợt triển khai phía Meta, vì vậy trước khi cho rằng max có thể dùng được, hãy kiểm tra xem route bạn đang gọi đã cập nhật bề mặt tham số của nó hay chưa — một proxy từng xác thực các giá trị được phép vào ngày 2 tháng 9 có thể sẽ từ chối "max" cho đến khi đội duy trì bắt kịp.

Max thực sự mang lại điều gì — và khi nào nó không giúp ích

Tài liệu hôm thứ Năm của Meta bao gồm sự phân chia rõ ràng giữa mức max và xhigh trên các điểm chuẩn mà họ chạy, và đây là điều hữu ích nhất mà họ từng công bố về mô hình này cho đến nay. Toàn bộ là do hãng báo cáo, được tạo ra bên trong bộ khung Muse Code của riêng Meta, và Meta cho biết các so sánh của họ với Claude Opus 5 và GPT-5.6 Sol là những lần chạy "cố gắng hết sức" ở cài đặt tối đa của chính các đối thủ đó, vốn "có thể không phản ánh hiệu suất được tối ưu hóa bởi nhà cung cấp." Với lưu ý đó, sự phân chia này cho thấy một xu hướng định hướng rõ ràng:

• OSWorld 2.0 (các tác vụ tác nhân sử dụng máy tính) — 66.9 ở mức max so với 57.2 ở mức xhigh

• GDPval-AA v2 (Elo tác nhân công việc tri thức) — 1.754 ở max so với 1.709 ở xhigh

• JobBench (các nhiệm vụ chuyên môn tầm xa) — 64.9 ở mức tối đa so với 61.2 ở mức rất cao

• DeepSearchQA — hòa ở mức 89.4

Terminal-Bench 2.1 (mã hóa tác tử terminal) — 89.2 ở mức xhigh so với 88.8 ở mức max, bộ đánh giá duy nhất mà cấu hình phát hành ngày 2 tháng 9 giành chiến thắng.

A comparison scoreboard titled 'Muse Spark 1.3 — max vs xhigh, the split'. Left column Max (released Sept 4, 2026): OSWorld 2.0 66.9, Terminal-Bench 2.1 88.8, GDPval-AA v2 (Elo) 1,754, JobBench 64.9, DeepSearchQA 89.4, Available to all developers. Right column Xhigh (released Sept 2, 2026): OSWorld 2.0 57.2, Terminal-Bench 2.1 89.2, GDPval-AA v2 (Elo) 1,709, JobBench 61.2, DeepSearchQA 89.4, Available to all developers. Footer: 'Benchmark splits per Meta's Sept 4 release materials — vendor-reported, not independently reproduced. Xhigh wins Terminal-Bench 2.1.' OrcaRouter logo bottom-right.

Mô thức này rất đáng để đọc kỹ. Max giúp ích nhiều nhất khi tác vụ là một vòng lặp tác tử dài — thao tác máy tính, xử lý một bản tóm tắt công việc tri thức, hoặc duy trì lịch trình các tác vụ con như JobBench vẫn làm. Trên một benchmark terminal một lượt tương tác, nó chẳng thêm được gì mà còn tốn thêm một chút: Terminal-Bench là lời nhắc rằng “suy luận nhiều hơn” không phải là một kiểu nâng cấp “càng nhiều càng tốt”, và đó là lý do bạn nên so sánh A/B max với xhigh trên khối lượng công việc của chính mình thay vì cho rằng cấu hình cao hơn sẽ tốt hơn ở mọi nơi. Meta cũng lưu ý rằng con số 75.4 của DeepSWE v1.1 — con số gây chú ý ngay trong ngày đầu, tăng so với 59.3 mà Meta công bố cho Muse Spark 1.2 sáu tuần trước đó — là kết quả đạt được với cấu hình max. Đó là con số mà các nhà đánh giá độc lập sẽ chạy lại trước tiên.

Bản phân tích độc lập đang dần bắt kịp.

Điều còn thiếu khi ra mắt là bất kỳ phép đo độc lập nào, và khoảng trống đó đang được thu hẹp theo một tiến độ trùng hợp với đợt triển khai max. Chỉ số Coding Agent của Artificial Analysis — chỉ số chấm điểm từng mô hình trong bộ khung coding-agent nguyên bản của nó và kết hợp các tác vụ DeepSWE, Terminal-Bench và SWE-Atlas — đã xếp Muse Spark 1.3 (max) trong bộ khung Muse Code ở mức 68 trong tuần này, đứng thứ hai trên bảng xếp hạng sau Claude Opus 5 (xhigh) trong Claude Code và xếp trên Claude Fable 5 (max) ở mức 67 cùng GPT-5.6 Sol (max) ở mức 65. Cùng bảng xếp hạng đó chấm cấu hình xhigh đang phát hành ở mức 64 trong cùng bộ khung Muse Code, đây là phép so sánh tương đương rõ ràng nhất cho đến nay về những gì max bổ sung — khoảng bốn điểm chỉ số — trên một bộ tác vụ độc lập. Hàng trên bảng xếp hạng đó được công bố khi max vẫn còn trong bản xem trước đối tác; cấu hình mà nó mô tả chính là cấu hình đã được phát hành rộng rãi vào ngày 4 tháng 9.

Artificial Analysis cũng đã cập nhật model card của riêng mình cho cấu hình tối đa kể từ khi ra mắt. Trong suốt giai đoạn xem trước, model card không ghi nhà cung cấp và không ghi giá; model card hiện hành nay ghi Meta với mức giá chuẩn $1.25 cho mỗi triệu token đầu vào và $4.25 cho mỗi triệu token đầu ra — cùng mức giá niêm yết với Muse Spark 1.2 — kèm thêm một lưu ý về tính dài dòng: lần chạy đánh giá của AA tiêu thụ khoảng 130 triệu token so với mức trung vị 79 triệu, tổng chi phí khoảng $1,335, và đạt gần $0.95 cho mỗi tác vụ theo ước tính mỗi tác vụ của AA, ở tốc độ khoảng 190 token đầu ra mỗi giây.

Một con số từ bài đưa tin trước đó cần được kiểm tra lại phiên bản. Artificial Analysis đã làm mới Intelligence Index lên v4.2 trong tuần này — cũng là tuần max ra mắt — tính điểm lại toàn bộ các mô hình và khiến các mức trung vị dịch chuyển. Trên bảng điểm hiện tại, cấu hình max đạt 53 so với mức trung vị 29 của các mô hình tương đương; con số 62 được lan truyền trong các bài đưa tin tuần ra mắt được đo trên phiên bản chỉ số trước đó, và hai con số này không thể so sánh được với nhau. Sự đối chiếu xhigh-versus-max của riêng Meta ở trên là độc lập với chỉ số của AA và không bị ảnh hưởng bởi đợt làm mới này.

A screenshot of the Artificial Analysis model page for Muse Spark 1.3 (max), showing a score of 53 on the Artificial Analysis Intelligence Index against a comparable-model median of 29, input pricing of $1.25 and output pricing of $4.25 per 1M tokens with an 88% cache discount, a per-task cost estimate near $0.95, about 190 output tokens per second, a 1M-token context window, and a note that the configuration is 'somewhat verbose' after generating roughly 130M tokens against a 79M median.

Chi phí tối đa là gì — hóa đơn tính bằng token, không phải theo bảng giá

Meta không công bố mức giá riêng cho cấu hình tối đa, cũng không có phân tích độ trễ chuyên dụng nào. Giá trên mỗi token giống hệt Muse Spark 1.2 và giống mọi mức nỗ lực khác trên Muse Spark 1.3: $1,25 cho mỗi triệu token đầu vào, $4,25 cho mỗi triệu token đầu ra và $0,15 cho token đầu vào được lưu cache ở gói tiêu chuẩn. Token suy luận được tính phí như token đầu ra và tính vào hạn mức đầu ra, vì vậy việc chọn mức tối đa không phải là một khoản tăng giá theo dòng mục — mà là cam kết dành nhiều hơn trong hạn mức đó để suy nghĩ trước khi trả lời.

Điều đó khiến câu hỏi chi phí thực sự trở thành vấn đề về khối lượng token, và dữ liệu ban đầu cho thấy max tốn kém đúng ở nơi xhigh gọn nhẹ. Quá trình chạy có đo lường của AA đã tiêu thụ khoảng 130 triệu token trong một lần đánh giá cấu hình. Đối với một nhà phát triển đã chạy các vòng lặp tác nhân dài ở xhigh, bài kiểm tra A/B đáng quan tâm không phải là "max có vượt qua nhiều tác vụ hơn không" mà là "max có vượt qua đủ số tác vụ bổ sung để chi trả cho hóa đơn token lớn hơn đáng kể trong cùng một khối lượng công việc hay không."

Bậc Contributor của Meta — $0.10 cho mỗi triệu token đầu vào và $0.20 cho mỗi triệu token đầu ra để đổi lại việc cho phép Meta huấn luyện trên các prompt và completion của bạn — áp dụng cho cùng một checkpoint, và Meta cho biết một tỷ lệ phần trăm hai chữ số đáng kể các nhà phát triển chọn nó. Các điều khoản của Contributor biến mọi bản gửi lên thành dữ liệu huấn luyện và giới hạn tốc độ của nó khá chặt, vì vậy đây là một lựa chọn mặc định kém cho việc fan-out trong sản xuất, nhưng lại là một cách hợp lý để chạy các thí nghiệm max tốn kém một cách rẻ tiền nếu bạn chấp nhận việc đánh đổi dữ liệu.

Mốc giá để đối chiếu toàn bộ điều này có thể kiểm chứng dễ dàng mà không cần tin lời Meta, vì checkpoint Muse Spark 1.3 được định giá giống hệt mức giá đang được niêm yết trên OrcaRouter với chính giá niêm yết của Meta: Muse Spark 1.2 đang được niêm yết trên OrcaRouter ở mức $1.25 mỗi triệu token đầu vào và $4.25 mỗi triệu token đầu ra, không cộng thêm bất kỳ khoản phụ phí nào. Vì vậy, tuyên bố "giá không đổi" có thể được kiểm chứng trên một trang trực tiếp hiển thị chính xác những con số đó. Bản thân Muse Spark 1.3 hiện chưa có trên OrcaRouter. Khi một nhà cung cấp trong danh mục của chúng tôi bắt đầu phục vụ bản này với max, mức giá hiển thị phía chúng tôi sẽ là giá niêm yết của Meta được chuyển thẳng — chúng tôi không cộng thêm bất kỳ khoản nào vào giá nhà cung cấp — và mọi đợt hạ giá từ hãng cũng sẽ có hiệu lực đúng vào ngày Meta công bố. Với một bản phát hành như thế này, khi phần kinh tế đáng chú ý nằm ở khối lượng token thay vì ở mức giá gây chú ý, thì cơ chế chuyển thẳng đó chính là thứ giữ cho con số bạn thực sự bị tính phí bằng đúng con số Meta công bố.

A screenshot of the OrcaRouter model page for Muse Spark 1.2, the checkpoint Muse Spark 1.3 is priced identically to, showing header stats $1.25 input and $4.25 output per million tokens, p50 time-to-first-token 7.84 s, p50 total 10.00 s and 48.9M, the description 'Muse Spark 1.2 is Meta's reasoning model for complex agentic tasks... a drop-in upgrade rather than a new tier', and the 'Get the Muse Spark 1.2 API' and 'Try in playground' buttons.

Ai nên chuyển sang max

Quyết định được chia tách rõ ràng:

• Switch cho khối lượng công việc tác tử tầm xa — sử dụng máy tính, bản tóm tắt công việc tri thức, vòng lặp công cụ đa bước trong Muse Code — nơi cả split của riêng Meta lẫn bảng tác tử mã hóa của AA đều cho thấy mức tăng tối đa lớn nhất. Hãy chạy A/B với xhigh trên một mẫu tác vụ thực tế trước, vì độ dài dòng là có thật.

Giữ nguyên xhigh cho các cuộc gọi khối lượng lớn, nhạy cảm độ trễ hoặc đơn vòng ngắn, nơi max chủ yếu chỉ thêm token. Terminal-Bench chính là minh chứng rằng nó không phải lúc nào cũng tăng khả năng.

Theo dõi ba điều từ đây: bản phát hành open-weights mà Zuckerberg đã hứa nhưng chưa chốt ngày, việc triển khai Muse Spark 1.3 đến người dùng trên Instagram, Facebook và Meta AI trong những tuần tới, và liệu bảng xếp hạng coding-agent của Artificial Analysis có bắt đầu định giá cho hàng max hay không khi cấu hình này đã được phát hành rộng rãi.

Kỳ hạn hai ngày hóa ra ngắn ngủi, nhưng nó đã tạo nên một điểm nhấn tồn tại lâu hơn cả đợt triển khai: những con số mạnh nhất của Muse Spark 1.3 của Meta {{1}}chưa bao giờ{{/1}} là ảo ảnh — chúng chỉ đang chờ một cuộc đánh giá an toàn. Kể từ ngày 4 tháng 9, mô hình mà nhà phát triển có thể gọi và mô hình trên bảng xếp hạng cuối cùng cũng là cùng một mô hình. Việc liệu max có xứng đáng với số token của nó hay không giờ là một câu hỏi thực nghiệm mà bất kỳ nhà phát triển nào cũng có thể trả lời, trên API của Meta {{2}}hoặc trên bất kỳ tuyến đường nào họ đã dùng để tiếp cận gia đình Muse Spark{{/2}}.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày