So sánh Muse Spark 1.2 và Muse Spark 1.1-1
Guides & Insights

Muse Spark 1.2 so với Muse Spark 1.1: Bạn có nên nâng cấp không?

Tác giả

Jim Song

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Meta đã thay thế Muse Spark 1.1 bằng Muse Spark 1.2 vào ngày 5 tháng 8 năm 2026 mà không thay đổi giá, cửa sổ ngữ cảnh, danh sách phương thức, các tham số được hỗ trợ hay mức độ suy luận. Do đó, việc di chuyển trông có vẻ miễn phí — cùng một chuỗi tên mô hình, cùng cách thanh toán, không có gì phải đàm phán lại. Nhưng thực ra không miễn phí. Đo lường độc lập cho thấy thời gian đến token đầu tiên của phiên bản mới là 26,12 giây so với 2,90 giây của phiên bản cũ, và tốc độ xuất ra liên tục là 165 token mỗi giây so với 213,5. Bạn đang mua ba điểm thông minh đo được với thời gian chờ gấp khoảng chín lần trước khi nhận được bất kỳ phản hồi nào.

Việc đó có đáng làm hay không gần như hoàn toàn phụ thuộc vào việc các tác vụ của bạn chạy trong bao lâu. Dưới đây là những gì thực sự khác biệt, những gì vẫn giữ nguyên, và những điều chưa ai có thể nói cho bạn biết.

Quyết định trong bốn dòng

• Chỉ số Trí tuệ: 51 → 54, được đo độc lập bởi Artificial Analysis tại cài đặt xhigh của từng phiên bản.

• Thời gian đến token đầu tiên: 2.90s → 26.12s, cùng nguồn, cùng điều kiện.

• Chi phí để chạy cùng một bộ benchmark: $548.07 → $637.85, với mức giá trên mỗi token giống hệt. 16% tăng thêm hoàn toàn là token bị đốt.

• Mọi thứ mà biểu mẫu mua sắm hỏi: giữ nguyên.

Muse Spark 1.2 vs Muse Spark 1.1-2

Điều gì thực sự giống hệt nhau

Điều này đáng để liệt kê vì đó là lý do khiến việc di chuyển trông có vẻ đơn giản trên giấy tờ, và vì một sự khác biệt không tồn tại là điều bạn không cần phải kiểm tra.

Giá — $1.25 trên mỗi triệu token đầu vào, $4.25 trên mỗi triệu token đầu ra, $0.15 trên mỗi triệu khi trúng cache, $2.50 trên mỗi nghìn lượt tìm kiếm web tích hợp. Tất cả các con số này đều giống nhau trên cả hai phiên bản.

Ngữ cảnh — cả hai đều có 1.048.576 token, không có mức phụ phí ngữ cảnh dài cho bên nào.

Phương thức — văn bản, hình ảnh, video, âm thanh và PDF đầu vào; văn bản đầu ra. Cả hai danh sách đều quảng cáo cùng năm loại đầu vào.

Núm điều chỉnh suy luận — bắt buộc có trên cả hai, năm mức (tối thiểu, thấp, trung bình, cao, rất cao), mặc định là trung bình trên cả hai. Không có cài đặt nào trên cả hai phiên bản để tắt tư duy.

Tham số — tools, tool_choice, structured_outputs, response_format, reasoning_effort, include_reasoning, max_tokens, temperature, top_p, top_k, repetition_penalty. Danh sách giống hệt nhau.

Phục vụ — một nhà cung cấp duy nhất, chính Meta, trên cả hai. Không có máy chủ bên thứ ba, không có biến thể lượng tử hóa.

Giá hỗn hợp — Artificial Analysis định giá cả hai ở mức 0,78 USD cho mỗi triệu token theo trọng số hỗn hợp của họ, điều mà bạn có thể mong đợi từ các bảng giá giống hệt nhau.

Nếu bạn hy vọng bản nâng cấp này sẽ có thêm ngữ cảnh, đảm bảo độ dài hoàn thành, hoặc bộ nhớ đệm rẻ hơn, thì không có đâu. Đây là bản phát hành chỉ thay đổi trọng số và hậu huấn luyện, với bảng giá được sao chép y hệt từ bản trước.

Điều gì thực sự đã chuyển động

Artificial Analysis hiện là bên độc lập duy nhất đã đánh giá cả hai phiên bản, và họ đã đánh giá cả hai ở mức nỗ lực suy luận cao nhất, vì vậy sự so sánh là tương đương.

Chỉ số Trí tuệ — 51 cho 1.1 (hạng #22 trên 185) lên 54 cho 1.2 (hạng #13). Chín bậc trên bảng xếp hạng trong khi trung vị của lớp là 32, vì vậy mức tăng mang lại vị trí thực sự, không chỉ là một số thập phân.

Thời gian đến token đầu tiên — 2,90s đến 26,12s. Đây là sự suy giảm nổi bật nhất và không hề nhỏ.

Tốc độ đầu ra — 213.5 đến 165.0 token mỗi giây. Vẫn xếp hạng #16 trên 185 và vẫn được Artificial Analysis mô tả là "nhanh đáng chú ý", nhưng chậm hơn 23% so với mô hình mà nó thay thế.

Độ dài dòng — 94 triệu token đầu ra để xử lý xong chỉ mục, so với 95 triệu. Về cơ bản không đổi, và cả hai đều cao hơn khoảng 45% so với mức trung vị 65 triệu.

Tổng chi phí đánh giá — $548.07 đến $637.85. Vì độ dài câu trả lời hầu như không đổi và giá cả không hề thay đổi, mức tăng 16% đó đến từ một nơi nào đó khác với đầu ra hiển thị: các chuỗi suy luận nội bộ dài hơn, nhiều lần thử lại hơn, hoặc nhiều lượt công cụ hơn cho mỗi tác vụ.

Mô hình này nhất quán. Meta không làm cho mô hình rẻ hơn, nhanh hơn hay lớn hơn. Họ khiến mô hình cân nhắc lâu hơn trước khi quyết định, và sự cân nhắc thêm đó hiện ra dưới dạng độ trễ, truyền phát chậm hơn một chút, và hóa đơn cao hơn 16% cho cùng một công việc. Ba điểm chỉ số là thứ mà điều đó đổi lại.

Độ trễ thực sự tệ đến mức nào

Con số 26.12 giây sẽ bị trích dẫn ngoài ngữ cảnh, vì vậy hãy hiểu đúng: nó được đo ở mức xhigh, mức tốn kém nhất trong năm mức độ nỗ lực, trên một bộ benchmark được thiết kế để thử thách. API mặc định là medium.

Để hình dung được cảm giác thực tế khi dùng mặc định, Muse Spark 1.1 trên OrcaRouter — phục vụ người gọi thực tế ở bất kỳ mức nỗ lực (effort) nào họ yêu cầu — cho thấy thời gian đến token đầu tiên ở phân vị 50 (p50) là 1.84 giây và ở phân vị 95 (p95) là 6.00 giây trong một tuần trượt. Đây là dữ liệu từ môi trường sản xuất, đo ở các mức nỗ lực (effort) vận hành thực tế, và nó thấp hơn chỉ số chuẩn (benchmark) đến hơn một bậc độ lớn. Phiên bản 1.2 chưa có dữ liệu telemetry trong sản xuất.

Muse Spark 1.2 vs Muse Spark 1.1-3

Vậy cách đọc trung thực không phải là "1.2 mất 26 giây để phản hồi." Mà là: ở cấu hình mà 1.2 đạt thêm ba điểm, token đầu tiên khiến bạn mất 26 giây, và ở cùng cấu hình đó, mô hình cũ khiến bạn mất ba giây. Nếu bạn đã chạy ở xhigh — chính là cấu hình mà sự cải thiện về trí thông minh tồn tại — thì đó là con số bạn nhận lấy. Nếu bạn chạy ở medium hoặc thấp hơn, bạn sẽ thấy thời gian ngắn hơn nhiều, và cũng sẽ thấy mức cải thiện ít hơn.

Sự gắn kết đó chính là cái bẫy thực sự trong lần nâng cấp này. Bạn không thể có được trí thông minh mà thiếu đi sự cân nhắc, bởi vì chính sự cân nhắc là nơi trí thông minh được sinh ra.

Sự tái định vị đằng sau những con số

Meta không đăng bài công bố phát hành nào cho bản 1.2 — trang thông báo Muse Spark vẫn mô tả bản 1.1 — nhưng họ đã viết lại mô tả sản phẩm, và phần viết lại đó giải thích sự đánh đổi.

Muse Spark 1.1 được bán ra như một mô hình suy luận đa phương thức với bề mặt đầu vào rộng một cách bất thường, nhắm đến "các tác nhân đa phương thức, nghiên cứu sâu trên phương tiện hỗn hợp và phân tích ngữ cảnh dài": các báo cáo dài, thư viện phương tiện, bản ghi âm và video cùng với văn bản.

Mô tả của Muse Spark 1.2 bỏ gần như tất cả những điều đó và thay vào đó nêu về kỹ thuật phần mềm — tái cấu trúc đa tệp, các phiên gỡ lỗi kéo dài, tạo toàn bộ kho lưu trữ — sau đó thêm một tuyên bố rõ ràng về đa tác tử: mô hình có thể đóng vai trò là tác tử chính thu thập bối cảnh, lập kế hoạch và phân công, hoặc là một tác tử phụ thực thi song song bên dưới. Nó cũng tuyên bố rằng bộ nhớ đệm lời nhắc có thể giảm chi phí hiệu quả từ 60–80% tùy thuộc vào mức độ lặp lại của bối cảnh giữa các lần gọi. Con số cuối cùng là ước tính của Meta chứ không phải kết quả đo được, mặc dù mức giá bộ nhớ đệm $0.15 khiến nó có vẻ hợp lý về mặt số học.

Đối chiếu độ trễ hồi quy với sự tái định vị đó, và nó không còn trông giống như một sai lầm nữa. Không ai tái cấu trúc hàng tá tệp tin lại quan tâm đến 26 giây lập kế hoạch. Meta đã chọn một khách hàng, và đó không phải là người mà phiên bản 1.1 được bán cho.

Những gì 1.1 vẫn có mà 1.2 không có

Bốn tuần tồn tại không đủ để tích lũy thành tích, và theo ba cách cụ thể, mẫu cũ hiện là sản phẩm được ghi chép đầy đủ hơn.

Một kỷ lục đấu trường.Muse Spark 1.1 có thành tích đáng kể tại Design Arena: 1334 Elo ở hạng 5 trong phát triển trò chơi, 1334 ở hạng 7 trong thành phần UI, 1320 ở hạng 3 trong nghệ thuật ASCII, 1318 trong trực quan hóa dữ liệu, 1309 trong các hạng mục mã nói chung, cùng một bảng xếp hạng agents-arena đầy đủ bao gồm ứng dụng web, slide HTML và phát triển trò chơi Godot. Muse Spark 1.2 hoàn toàn không có bản ghi nào. Trên phương diện mà Meta hiện đang tiếp thị mạnh mẽ nhất, không có dữ liệu đối đầu trực tiếp nào cho mô hình mới.

Điểm chỉ số phụ. Artificial Analysis công bố chỉ số lập trình là 71.3 và chỉ số tác nhân là 37.5 cho phiên bản 1.1. Không có số liệu tương ứng nào được công bố cho 1.2. Vì điểm tác nhân là khía cạnh yếu nhất của 1.1 với cách biệt lớn, và khả năng tác nhân chính là thứ mà 1.2 tuyên bố cải thiện, đây là con số có thể giải quyết câu hỏi về việc nâng cấp — nhưng con số đó vẫn chưa tồn tại.

Telemetry sản xuất. 1.1 có một tuần số liệu độ trễ p50 và p95 thực tế và 4,4 triệu token lưu lượng trực tiếp trên OrcaRouter. 1.2 không có cả hai; endpoint của nó hiện không báo cáo bất kỳ số liệu thống kê độ trễ hoặc thông lượng nào vì lưu lượng quá thấp để lấy mẫu.

Một nơi nào đó để thuê nó ngoài Meta. Muse Spark 1.1 có trong danh mục OrcaRouter với giá $1.25 và $4.25 — giá niêm yết của Meta, được chuyển qua với mức chênh lệch 0%. Muse Spark 1.2 chưa có ở đó, vì vậy hiện tại nó là tích hợp trực tiếp với Meta với một nhà cung cấp duy nhất và không có đường dự phòng.

Muse Spark 1.2 vs Muse Spark 1.1-4

Không điều nào trong số này có nghĩa là 1.2 tệ hơn. Nó có nghĩa là bằng chứng cho 1.2 chỉ gồm một điểm tổng hợp từ một người đánh giá, trong khi bằng chứng cho 1.1 là một tháng đấu trường, chỉ số phụ và lưu lượng truy cập trực tiếp. Sự chênh lệch đó nên ảnh hưởng đến cách bạn phân giai đoạn di chuyển, chứ không phải việc có nên thử hay không.

Một danh sách kiểm tra di chuyển thực sự ngắn gọn

Vì bảng giá và bề mặt tham số giống hệt nhau, việc hoán đổi chỉ là thay đổi chuỗi mô hình. Công việc nằm ở việc xác minh ba thứ đã dịch chuyển.

Hãy tự đo thời gian đến token đầu tiên với cài đặt effort của riêng bạn. Đừng chấp nhận con số 2,90 giây hay 26,12 giây. Hãy chạy các prompt thực tế của bạn với bất kỳ reasoning_effort nào bạn thực sự truyền vào và so sánh trực tiếp. Đây chính là con số duy nhất có thể giết chết hoàn toàn việc chuyển đổi.

Kiểm tra cấu hình timeout và streaming của bạn. Mức tăng gấp 9 lần độ trễ token đầu tiên ở mức effort cao sẽ vượt quá giới hạn timeout của client vốn được tinh chỉnh theo phiên bản 1.1, và sẽ khiến mọi tích hợp không dùng streaming trông như bị treo.

Tính lại chi phí từ số token đo được, không phải từ bảng giá. Giá cả giống hệt nhau, vì vậy mọi thay đổi chi phí đều do hành vi. Artificial Analysis nhận thấy mức chi tiêu cao hơn 16% cho cùng một khối lượng công việc; việc bạn có thấy điều đó hay không phụ thuộc vào cơ cấu tác vụ của bạn.

Trước tiên hãy xác minh tính ổn định của khóa cache. Với tiền tố 60.000 token ổn định, một bước agent điển hình giảm từ khoảng 8,8 xu xuống khoảng 2,2 xu trên cả hai phiên bản. Mức chênh lệch 75% đó lớn hơn bất kỳ tác động nào do việc thay đổi phiên bản gây ra và hoàn toàn nằm trong tầm kiểm soát của bạn.

Kiểm thử lại các luồng âm thanh và video một cách tường minh.Cả hai danh sách đều quảng cáo năm phương thức nhập liệu giống nhau, nhưng thẻ thông số của Artificial Analysis cho phiên bản 1.2 chỉ ghi nhận văn bản và hình ảnh trong phần đánh giá. Meta đã viết lại lời quảng bá, không còn nhấn mạnh vào công việc đa phương tiện. Chưa có bên độc lập nào kiểm chứng liệu khả năng đó có còn được duy trì hay không.

Giữ 1.1 khả dụng như một phương án dự phòng. Chạy cả hai sau cùng một key nghĩa là việc rollback chỉ là thay đổi cấu hình chứ không phải một sự cố, và nó cho phép bạn A/B hai phiên bản trên lưu lượng trực tiếp thay vì tranh cãi về benchmark.

Ai di chuyển bây giờ, ai chờ đợi

Hãy chuyển ngay nếu bạn chạy các tác nhân lập trình tầm xa với nỗ lực suy luận cao. Các tác vụ vốn đã mất nhiều phút, chi phí độ trễ biến mất trong khoảng thời gian đó, mức tăng trí tuệ được đo bởi bên thứ ba chứ không phải do Meta tự nhận, và ba điểm chỉ số là một bước nhảy đáng kể ở mức này — chín bậc trên bảng xếp hạng 185 mô hình.

Khoan đã nếu bất cứ thứ gì bạn phục vụ mang tính tương tác. Không có cấu hình nào mà 1.2 phản hồi nhanh hơn 1.1, và chế độ lý luận bắt buộc có nghĩa là bạn không thể mua lại sự phản hồi nhanh bằng cách tắt suy nghĩ. Phiên bản 1.1 vẫn là mô hình nhanh hơn ở mọi mức độ nỗ lực và có chi phí hoàn toàn giống nhau.

Khoan đã nếu khối lượng công việc của bạn là phân tích đa phương tiện — trường hợp sử dụng báo cáo dài, video và âm thanh mà 1.1 được xây dựng và tiếp thị một cách rõ ràng để phục vụ. Meta đã ngừng quảng cáo nó và đánh giá độc lập duy nhất về 1.2 chỉ bao gồm văn bản và hình ảnh. Khả năng này rất có thể vẫn còn nguyên vẹn; chỉ đơn giản là không có bằng chứng nào ủng hộ hay phủ nhận, và 1.1 đã có một tháng với khả năng đó.

Khoan đã nếu bạn cần dữ liệu đấu trường. Một mô hình được bán dựa trên khả năng tạo toàn bộ kho lưu trữ, không có mục nào trong Design Arena và không có chỉ số phụ về tác nhân nào được công bố, đang yêu cầu bạn tin lời Meta về chính thứ mà họ đã thay đổi. Hãy đợi ba hoặc bốn tuần nữa và điều đó sẽ không còn đúng — lúc đó quyết định này sẽ dễ đưa ra hơn nhiều dựa trên bằng chứng thay vì dựa trên một con số tổng hợp duy nhất.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

Liên hệ với chúng tôi

Tham gia cộng đồng

DiscordEmailXGitHubYouTube