
Đánh giá Meta Muse Spark 1.1: Vẫn là chiếc nhanh, nhưng không còn là chiếc rẻ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 984 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 195 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
Trong bốn tuần, lý lẽ ủng hộ Meta Muse Spark 1.1 là phép tính số học. $1,25 cho mỗi triệu token đầu vào, $4,25 cho đầu ra, dành cho mô hình đa phương thức gốc chạy công cụ tốt hơn hầu hết mọi thứ trong tầm giá. Rồi vào ngày 5 tháng 8 năm 2026, Meta ra mắt Muse Spark 1.2 cùng với Muse Code — tác tử lập trình đầu cuối đầu tiên của họ — và gắn vào mô hình mới một thứ mà 1.1 chưa từng có: một hạng đóng góp với $0,10 đầu vào và $0,20 đầu ra. Rẻ hơn mười hai lần cho đầu vào, rẻ hơn hai mươi mốt lần cho đầu ra, đổi lại việc cho phép Meta huấn luyện trên các lời nhắc của bạn. Giá của Muse Spark 1.1 không nhúc nhích một xu. Nhưng vị thế của nó thì có.
Đó là khuôn khổ trung thực để đánh giá mô hình này ở thời điểm hiện tại. Muse Spark 1.1 chưa bị ngừng hỗ trợ, chưa bị điều chỉnh giá, và vẫn là checkpoint suy luận nhanh hơn và có tài liệu đầy đủ hơn trong hai checkpoint của Meta — nhưng nó không còn là cách rẻ nhất để thuê một mô hình Meta, và agent mà Meta đang đẩy mạnh nhất lại không chạy trên nó. Bài đánh giá này sẽ đề cập đến: 1.1 là gì, nó thực sự giỏi ở những điểm nào, đợt ra mắt tháng 8 đã thay đổi những gì, và tập hợp hẹp hơn các công việc mà nó vẫn là lựa chọn đúng đắn. Nếu một con số đến từ đánh giá của chính Meta, bài viết sẽ nói rõ; nếu nó đến từ Artificial Analysis hoặc từ lưu lượng vận hành thực tế, bài viết cũng nói rõ điều đó.
Nhận xét nhanh
• Nó là gì — một mô hình suy luận đa phương thức gốc (đầu vào: văn bản, hình ảnh, video, PDF và âm thanh; đầu ra: văn bản) với mức độ suy luận có thể tùy chỉnh, được xây dựng để chạy các công cụ và điều khiển máy tính. Trọng số đóng, do Meta cung cấp.
• Giá — $1.25 đầu vào / $4.25 đầu ra cho mỗi triệu token, $0.15 khi trúng bộ nhớ đệm. Không đổi kể từ khi ra mắt, và vẫn chỉ bằng khoảng một phần tư giá đầu ra của GPT-5.6 Sol ($5/$30) và một phần sáu của Claude Opus 4.8 ($5/$25).
• Trí thông minh — 51 trên Artificial Analysis Intelligence Index, xếp hạng #22 trong số 185 ở cùng nhóm, so với mức trung bình của nhóm là 32. Một phép đo độc lập, không phải tuyên bố của Meta.
• Điểm mạnh — sử dụng công cụ và lập luận tác nhân, cùng tốc độ thực sự nhanh: 213.5 token đầu ra mỗi giây, được Artificial Analysis xếp hạng #2 trong số 185.
• Điểm yếu — khả năng suy luận thuần túy và viết mã thô chỉ ở mức trung bình, khả năng truy hồi ngữ cảnh dài không thuộc nhóm dẫn đầu, và nó dài dòng: cần 94 triệu token đầu ra để hoàn thành Chỉ số Trí tuệ so với mức trung vị 65 triệu.
• Lưu ý mới — Muse Spark 1.2 hiện đạt điểm cao hơn ba điểm và ở gói contributor, chi phí chỉ bằng một phần hai mươi. Lợi thế còn lại của bản 1.1 là độ trễ, và đó là một lợi thế lớn.
Meta đã tung ra điều gì vào ngày 5 tháng 8 — và nó đã làm gì với 1.1
Muse Code là một tác nhân lập trình trên terminal, hiện đang trong giai đoạn beta, được cài đặt từ một script shell một dòng trên macOS và Linux (không có bản dành cho Windows) và chạy dưới dạngmuse binary. Nó đảm nhận các tác vụ kỹ thuật phần mềm hoàn chỉnh trên các kho mã lớn: lập kế hoạch thay đổi, viết mã, xác thực kết quả. Điểm nhấn của Meta là sự gắn kết về kiến trúc — tác nhân và mô hình được huấn luyện cùng nhau thay vì ghép lại — và danh sách tính năng nhắm thẳng vào Claude Code và Codex: các tác nhân nền tiếp tục hoạt động sau khi bạn đóng terminal, tiếp tục từ nhật ký sự kiện, các worktree song song của tác nhân phụ, và một sandbox hệ điều hành với các phê duyệt được bật theo mặc định. Bản demo mà Meta công bố cho nó là một vòng lặp tối ưu hóa nhân GPU chạy hơn 1.000 lần gọi công cụ trong suốt 24 giờ trên phần cứng NVIDIA Hopper.
Muse Code chạy Muse Spark 1.2, không phải 1.1. Đó là hệ quả thực tiễn đầu tiên cho bất kỳ ai đọc bài đánh giá này: nếu bạn muốn có agent của Meta, bạn đang ở checkpoint mới.
Hệ quả thứ hai là giá cả, và đó là điều thú vị hơn. Meta đã phát hành 1.2 với hai ID mô hình riêng biệt thay vì một:
• Standard (muse-spark-1.2) — 1,25 USD cho đầu vào, 0,15 USD cho đầu vào được lưu trong bộ nhớ đệm, 4,25 USD cho đầu ra trên mỗi triệu token. Giống hệt Muse Spark 1.1. Meta cam kết rằng các lời nhắc và phần hoàn thành trên gói này sẽ không được sử dụng để cải thiện sản phẩm của họ.
• Người đóng góp (muse-spark-1.2-contributor) — $0.10 đầu vào, $0.002 đầu vào đã lưu cache, $0.20 đầu ra. Đổi lại, bạn cấp cho Meta quyền sử dụng các lời nhắc và câu trả lời của bạn để huấn luyện các mô hình trong tương lai.
• Muse Spark 1.1 — không có gói cộng tác viên nào. Sản phẩm vẫn giữ mức giá tiêu chuẩn, và Meta không công bố việc ngừng hỗ trợ.
Cách trình bày của chính Meta về gói đóng góp là nó "rẻ hơn 10 lần so với cả gói trả theo mức sử dụng," nhưng điều đó còn đánh giá thấp thực tế: bội số thực là 12,5× cho đầu vào và 21,25× cho đầu ra, với đầu vào được lưu trong bộ nhớ đệm ở mức gần như miễn phí 0,002 đô la. Đó chính là tiêu đề "giá thấp" mà đợt ra mắt tạo ra, và nó chỉ thuộc về riêng 1.2.

Câu chuyện giá cả, viết lại
Trước khi bạn tính lại ngân sách quanh mức 0,20 đô la cho mỗi token đầu ra, hãy đọc phần còn lại của các điều khoản trong gói contributor, vì chính chúng mới là thứ làm cho nó rẻ. Giới hạn tốc độ giảm từ mức 3.000 yêu cầu mỗi phút được ghi nhận trên gói tiêu chuẩn xuống còn 60 trên gói contributor — một giới hạn cho phép một nhà phát triển thử nghiệm trên laptop nhưng ngăn cản một đội tác tử vận hành trong sản xuất. Và sự đánh đổi dữ liệu không phải là hình thức: các prompt của bạn và các completion của model của bạn sẽ trở thành tài liệu huấn luyện. Đối với bất kỳ ai xử lý dữ liệu khách hàng, mã nguồn độc quyền, hoặc bất cứ thứ gì thuộc nghĩa vụ bảo mật, gói contributor không phải là phiên bản rẻ hơn của cùng một sản phẩm; nó là một sản phẩm khác. Meta đã thừa nhận điều đó ngay tại buổi ra mắt bằng cách bổ sung tùy chọn không lưu giữ dữ liệu cho khách hàng doanh nghiệp ở gói trả phí.
Vậy nên sự so sánh trung thực không phải là "1.1 với giá 4,25 đô la so với 1.2 với giá 0,20 đô la." Mà là: ở mức giá tiêu chuẩn, hai mô hình có chi phí hoàn toàn giống nhau, và 1.2 là mô hình đạt điểm cao hơn. Gói giá 0,20 đô la là một ưu đãi thực sự và mạnh mẽ, nhưng nó nhắm đến các cá nhân và thử nghiệm, và chỉ khả dụng trên mô hình mới hơn.
{{1}}Điều thực sự quyết định hóa đơn trên cả hai mô hình là bộ nhớ đệm (caching), không phải mức giá niêm yết.{{/1}} {{2}}Lấy một bước tác nhân (agent) tiêu biểu: 60.000 token ngữ cảnh kho lưu trữ hoặc tài liệu đưa vào, 3.000 token kế hoạch và câu trả lời đưa ra.{{/2}} {{3}}Khi cache lạnh, chi phí là $0,075 cho đầu vào cộng $0,013 cho đầu ra{{/3}} — khoảng 8,8 xu, tức $88 cho một nghìn bước. {{4}}Giữ tiền tố ngữ cảnh ổn định để nó trúng cache ở mức $0,15 mỗi triệu token, đầu vào tụt xuống còn $0,009,{{/4}} đưa mỗi bước về khoảng 2,2 xu và một nghìn bước còn $22. {{5}}Chênh lệch 75%, được quyết định hoàn toàn bởi việc khung tác nhân (agent framework) của bạn tái sử dụng tiền tố ổn định hay dựng lại prompt mỗi lượt.{{/5}} {{6}}Nếu sau khi đọc bài đánh giá này bạn chỉ thực hiện một hành động kỹ thuật, hãy chọn sự ổn định của cache-key thay vì chọn mô hình.{{/6}}
Một lưu ý về cấu trúc tại nơi bạn thuê dịch vụ. Muse Spark 1.1 nằm trong danh mục OrcaRouter với giá $1.25 và $4.25, kèm phí đọc cache $0.15 — con số giống hệt mức Meta tính, vì OrcaRouter áp dụng biên lợi nhuận 0% và chuyển thẳng giá niêm yết của nhà cung cấp, nên khi nhà cung cấp thay đổi giá, tại đây cũng cập nhật đúng ngày hôm đó. Muse Spark 1.2 chưa có trong danh mục và do Meta trực tiếp phục vụ. Điều này quan trọng đối với phép so sánh mà bạn có lẽ sắp thực hiện: GPT-5.6 Sol, Claude Opus 4.8, Grok 4.5 và Gemini 3.1 Pro đều nằm sau một khóa truy cập duy nhất với giá niêm yết, nên bạn có thể benchmark chúng với Muse Spark 1.1 trên cùng một bộ đánh giá mà không cần hợp đồng thứ hai — con số trong bảng tính của bạn chính là con số trên hóa đơn.
Muse Spark 1.1 thực sự là gì
Muse Spark là dòng mô hình suy luận chủ lực của Meta Superintelligence Labs — nhóm mà Mark Zuckerberg đã thành lập và giao cho Alexandr Wang lãnh đạo. Đây là một sự đảo ngược chiến lược: trong khi các mô hình Llama của Meta là open-weight, thì gia đình Muse — gồm Spark cùng các trình tạo hình ảnh và video — lại là mã đóng và được cung cấp như một sản phẩm và một API. Spark 1.0 ra mắt ngày 8/4/2026; phiên bản 1.1 tiếp nối vào ngày 9/7, trùng với bản xem trước công khai của Meta Model API. Thay đổi thực tế cho các nhà phát triển là Meta giờ đây là nhà cung cấp API hạng nhất cạnh tranh trực tiếp với hai nhà cung cấp API hiện hữu — không còn chỉ là nơi phát hành trọng số — và việc ra mắt tác nhân lập trình vào ngày 5/8 là minh chứng rõ ràng nhất cho điều đó.
Phiên bản 1.1 là một bước tiến đáng kể chứ không chỉ là bản cập nhật nhỏ. Trên Artificial Analysis, chỉ số Intelligence Index của nó đã tăng 8 điểm trong ba tháng, từ 43 lên 51. Chỉ số lập trình tăng 12 điểm lên 71, SciCode được cải thiện lên 58%, và Humanity's Last Exam tăng lên 45%. Meta cho biết những cải thiện lớn nhất nằm ở khả năng sử dụng công cụ, sử dụng máy tính, lập trình và hiểu đa phương thức — phù hợp với một mô hình được tinh chỉnh để hành động thay vì chỉ trả lời.
Về ngữ cảnh, sự nhầm lẫn trước đó đã được giải quyết: Artificial Analysis và OrcaRouter đều liệt kê cửa sổ ở mức 1.048.576 token, còn Meta mô tả một cửa sổ mà mô hình chủ động nén lại. Tuy nhiên, giữ một triệu token không đồng nghĩa với việc truy hồi được từ chúng, và điểm truy hồi ngữ cảnh dài khoảng 54,1 của bản 1.1 cho thấy khả năng truy hồi chỉ ở mức bình thường. Hãy coi cửa sổ này là một năng lực, chứ không phải một sự đảm bảo.
Mức độ suy luận: Tức thời, Suy ngẫm, và núm điều chỉnh bên dưới
Trên bề mặt tiêu dùng của Meta, Muse Spark phơi bày hai chế độ được đặt tên: **Instant answers** trả lời ngay lập tức mà không cần suy luận mở rộng, giống như một lượt trò chuyện tiêu chuẩn; **Contemplating** chạy nhiều tác tử song song bằng kỹ thuật "nén suy nghĩ" (thought compression) vay mượn từ học tăng cường, và Meta định vị nó đối đầu với DeepMind Deep Think và GPT-5.4 Pro trong các tác vụ khoa học và phân tích đòi hỏi cao. Qua API, khả năng tương tự xuất hiện dưới dạng tham số mức độ suy luận có thể cấu hình — Artificial Analysis công bố điểm số của nó ở cài đặt xhigh của mô hình, mức đắt nhất mà nó phơi bày.
Hãy coi núm xoay đó như một đòn bẩy chi phí, không phải thanh trượt chất lượng. Suy luận đa tác tử song song tiêu tốn nhiều token hơn hẳn một lượt xử lý đơn lẻ, và các con số điểm chuẩn bạn đọc được là kết quả của mức nỗ lực tối đa. Mặc định dùng mức thấp cho các cuộc gọi thông thường và dành nỗ lực cao cho những trường hợp câu trả lời đầu tiên sai sẽ gây tổn thất đắt đỏ.
Cách chấm điểm: mạnh khi có công cụ, trung bình khi không có
Cách đọc rõ ràng nhất về Muse Spark 1.1 là so sánh khi có công cụ và khi không có công cụ. Với công cụ, nó dẫn đầu các bài kiểm tra tác tử: MCP Atlas 88.1 so với Claude Opus 4.8 là 82.2, JobBench 54.7 so với 48.4, Legal Agent Bench 20.0 so với Grok 4.5 là 12.9, và Humanity's Last Exam với công cụ là 62.1 so với 57.9. Không có công cụ, nó khá bình thường — Humanity's Last Exam thuần túy đạt khoảng 45, kém xa mức khoảng 77 của Gemini 3.1 Pro trong cùng bài kiểm tra.
Về độ chính xác khi thực thi, nó cũng xếp sau các mô hình dẫn đầu: OSWorld-Verified computer use đạt 80.8 so với 83.4 của Opus 4.8, SWE-Bench Pro coding 61.5 so với 69.2, DeepSWE 1.1 long-horizon coding 53.3 so với 67.0 của GPT-5.5, và BabyVision visual reasoning 76.3 so với 83.6. Nhiều con số trong số này do nhà cung cấp công bố, một số từ chính các bài đánh giá của Meta, và chúng chạy trên các nền tảng khác nhau — hãy xem chúng như các chỉ số định hướng và tự kiểm tra lại trên tác vụ của bạn.

Bức tranh độc lập từ Artificial Analysis gọn gàng và hữu ích hơn. Chỉ số Trí tuệ (Intelligence Index) 51, xếp hạng #22/185, so với mức trung vị 32 của nhóm. Tốc độ 213,5 token đầu ra mỗi giây, xếp hạng #2/185 — đây thực sự là một mô hình nhanh. Xếp hạng giá #31, giá trúng bộ nhớ đệm $0.15 với mức giảm 88%. Độ dài dòng (verbosity) 94 triệu token đầu ra để hoàn thành bài đánh giá, so với mức trung vị 65 triệu — và đây chính là nguồn tạo ra phần lớn hóa đơn thực tế. Tổng chi phí để đánh giá mô hình trên toàn bộ bộ thử nghiệm: $548.07.
Một lưu ý đáng ghi nhớ: Meta quảng cáo hỗ trợ đầu vào văn bản, hình ảnh, video, âm thanh và PDF, nhưng thẻ thông số kỹ thuật của Artificial Analysis cho 1.1 chỉ ghi nhận văn bản và hình ảnh là được đánh giá. Cả hai đều có thể đúng — API chấp nhận nhiều định dạng hơn những gì bộ khung đánh giá đã thử nghiệm — nhưng ngoài Meta, chưa ai công bố kết quả trên tác vụ video hoặc âm thanh. Nếu phân tích đa phương tiện là lý do bạn đến đây, hãy dành thời gian để tự xác minh.
Bạn có nên chuyển sang 1.2? Câu trả lời về độ trễ
Về mảng coding, Meta nói có, và các con số của họ nhất quán nội bộ: Terminal-Bench 2.1 tăng từ 76.2% lên 82.9%, DeepSWE v1.1 từ 53.0% lên 59.3%, và benchmark coding nội bộ của họ từ 68.3% lên 70.6%. Đây là các đánh giá do Meta chạy, chấm điểm pass@1 qua năm lần thử trong harness của riêng Meta — caveat tiêu chuẩn vẫn áp dụng, đó là các mô hình đối thủ trong harness của một nhà cung cấp thường bị tinh chỉnh kém. Một cách độc lập, Artificial Analysis đã đưa Muse Spark 1.2 lên 54 trên Chỉ số Trí tuệ, xếp hạng #13 trong số 185, cao hơn ba điểm so với phiên bản 1.1.
Thứ Meta dùng để trả cho những điểm số đó là sự cân nhắc kỹ lưỡng, và điều đó thể hiện rõ trong từng phép đo thời gian. Artificial Analysis đo thời gian đến token đầu tiên là 26,12 giây cho bản 1.2 so với 2,90 giây cho bản 1.1 — cả hai đều ở mức nỗ lực suy luận cao nhất của từng mô hình. Tốc độ xuất ra giảm từ 213,5 xuống 165 token mỗi giây. Độ dài văn bản tăng nhẹ, 95M so với 94M token, và chi phí chạy cùng một bộ benchmark giống hệt tăng từ $548,07 lên $637,85 với mức giá trên mỗi token không đổi. Con số cuối cùng là phát biểu rõ ràng nhất về sự đánh đổi: cùng một bảng giá, thêm 16% token tiêu thụ, thêm ba điểm chỉ số.
Hãy đọc kỹ con số 26 giây, vì rất dễ hiểu sai. Đây là phép đo benchmark ở mức nỗ lực tối đa, còn API mặc định ở mức trung bình. Để có điểm tham chiếu lưu lượng thực tế, Muse Spark 1.1 trên OrcaRouter — phục vụ mức nỗ lực mà người gọi thực sự yêu cầu — cho thấy thời gian đến token đầu tiên ở phân vị p50 là 1.84 giây và p95 là 6.00 giây trong suốt một tuần lưu lượng sản xuất, với tỷ lệ lỗi bằng không. Độ trễ benchmark ở mức nỗ lực tối đa và độ trễ sản xuất ở mức nỗ lực mặc định là các đại lượng khác nhau, và khoảng cách giữa chúng thường lớn hơn một bậc độ lớn.
So quyết định được phân định rõ ràng dựa trên hình thái khối lượng công việc. Nếu bạn đang chạy các tác nhân lập trình tầm xa giữ kho mã trong ngữ cảnh và làm việc trong nhiều phút liền, thì 1.2 là mô hình tốt hơn, và chi phí độ trễ sẽ được bù trừ dần trong một tác vụ vốn chưa bao giờ được kỳ vọng là tức thì. Nếu bạn đang phục vụ bất kỳ thứ gì mang tính tương tác — giao diện chat, vòng lặp gọi công cụ với người dùng đang chờ đợi, SLO độ trễ tính bằng giây — thì Muse Spark 1.1 vẫn là mô hình có cấu trúc phù hợp hơn trong gia đình, và thứ hạng tốc độ của nó không phải là một sai số làm tròn. Không có gì trong bản phát hành tháng Tám thay đổi điều đó.
Trải nghiệm nhà phát triển và giới hạn
API Meta Model vẫn ở dạng bản xem trước công khai, mặc dù bản phát hành hồi tháng 8 đã mở rộng quyền truy cập toàn cầu và bổ sung tùy chọn không lưu giữ dữ liệu dành cho doanh nghiệp. Meta cung cấp giao diện kiểu OpenAI và quyền truy cập SDK, đồng thời Spark đã có mặt cho người tiêu dùng trong chế độ "Thinking" của Meta AI. Giới hạn tốc độ hiện đã được công bố thay vì phải đoán — 3.000 yêu cầu mỗi phút được ghi rõ cho gói tiêu chuẩn — nhưng trạng thái xem trước vẫn chỉ là trạng thái xem trước, vì vậy hãy giữ một đường dự phòng cho những ngày năng lực bị hạn chế. Chuyển đổi dự phòng tự động giữa các nhà cung cấp chính là loại hạ tầng mà một endpoint cấp xem trước cần đến, và đó là lý do việc định tuyến một mô hình xem trước qua cổng kết nối không tốn kém gì mà lại mang đến cho bạn một đường đi thứ hai.

Thông qua OrcaRouter, ID mô hình là meta/muse-spark-1.1 và cả /v1/chat/completions lẫn /v1/responses đều có sẵn, do đó một client tương thích OpenAI hiện có chỉ cần một base URL và một chuỗi mô hình, không cần gì khác:
import openai as openai_client
client = openai_client.Client(base_url="https://api.orcarouter.ai/v1", api_key="YOUR_API_KEY")
response = client.chat.completions.create(model="meta/muse-spark-1.1", messages=[{"role": "user", "content": "Lên kế hoạch và chạy các công cụ để khắc phục sự cố này."}])
print(response.choices[0].message.content)
Nơi nó phù hợp — và nơi nó không phù hợp
Phù hợp tốt: tự động hóa chạy công cụ và sử dụng máy tính trong đó thời gian phản hồi hiển thị trước mắt người dùng; suy luận nhạy cảm về chi phí ở quy mô lớn trên dữ liệu bạn không thể đưa vào tập huấn luyện; quy trình làm việc kết hợp văn bản với hình ảnh, video, PDF hoặc âm thanh, với việc bạn tự xác minh trên đường dẫn phương tiện; và các nhóm muốn một mặc định nhanh, rẻ, với một mô hình cao cấp được giữ dự phòng cho những bước khó nhất.
Không phù hợp: độ chính xác lập trình đứng đầu bảng xếp hạng và các bài toán kỹ thuật greenfield khó nhất, vốn vẫn thuộc về Claude Opus 4.8 và GPT-5.6 Sol; các bài toán suy luận thuần túy không có công cụ; các tác vụ đòi hỏi độ chính xác thị giác mà Gemini 3.1 Pro dẫn đầu; công việc kho lưu trữ dài hạn, hiện rõ ràng là nhiệm vụ của 1.2 và Muse Code; và bất cứ thứ gì bạn cần token rẻ nhất có thể của Meta, vì mức giá đó không tồn tại trên mô hình này.
FAQ
Muse Spark 1.1 có còn khả dụng nữa không khi 1.2 đã được phát hành?
Đúng. Meta đã công bố không ngừng hỗ trợ và không thay đổi giá tại sự kiện ra mắt ngày 5/8 — phiên bản 1.1 vẫn còn trên Meta Model API với giá 1,25 và 4,25 đô la mỗi triệu token, và nó nằm trong danh mục OrcaRouter với cùng mức giá đó. Các bài đưa tin về sự kiện ra mắt đều mô tả nhất quán rằng nó tiếp tục giữ nguyên mức giá API hiện tại. Tuy nhiên, sự tập trung kỹ thuật của Meta đã chuyển hướng rõ ràng: tác nhân lập trình, các benchmark mới và gói giá rẻ đều gắn với phiên bản 1.2.
Tôi có thể nhận Muse Spark 1.1 với gói đóng góp $0.10 không?
Không. Bậc Contributor là một ID mô hình riêng trên checkpoint mới hơn, muse-spark-1.2-contributor. Không có phiên bản tương đương 1.1, vì vậy để có được token suy luận Meta rẻ nhất, bạn phải chuyển sang phiên bản mới — và chấp nhận giới hạn 60 yêu cầu mỗi phút cùng với việc cho phép Meta sử dụng các prompt và phản hồi của bạn để huấn luyện.
Tôi có nên nâng cấp lên Muse Spark 1.2 không?
{{1}}Nếu khối lượng công việc của bạn là mã hóa chạy lâu dài hoặc công việc agent ở quy mô kho lưu trữ, thì có: nó đạt điểm cao hơn trên cả đánh giá mã hóa của chính Meta và chỉ số độc lập của Artificial Analysis, ở cùng mức giá tiêu chuẩn.{{/1}} {{2}}Nếu khối lượng công việc của bạn mang tính tương tác hoặc nhạy cảm với độ trễ, thì không:{{/2}} {{3}}1.2 đánh đổi khoảng chín lần thời gian đến token đầu tiên và 23% tốc độ đầu ra để lấy ba điểm chỉ số, và khả năng suy luận của nó không thể tắt được.{{/3}} {{4}}Cả hai đều nằm trên cùng một API, vì vậy dù thế nào đi nữa, việc chuyển đổi chỉ là một chuỗi mô hình — đây là bài kiểm tra A/B rẻ nhất có thể và đáng để chạy trên lưu lượng truy cập của riêng bạn trước khi quyết định.{{/4}}
Muse Spark 1.1 có phải là mã nguồn mở không?
Không, và đó chính là điểm của dòng sản phẩm này. Không giống như các mô hình Llama của Meta, dòng Muse có trọng số đóng và được phân phối dưới dạng sản phẩm và API. Không có trọng số nào trên Hugging Face, không có đường dẫn tự lưu trữ, và không có nhà cung cấp bên thứ ba — Meta là bên duy nhất phục vụ mô hình này, điều này khiến cho lớp định tuyến có dự phòng trở thành giải pháp thực tế cho rủi ro nhà cung cấp đơn lẻ thay vì một nhà cung cấp thứ hai.
Phán quyết, một phiên bản sau
Muse Spark 1.1 là một mô hình agentic đa phương thức thực sự, nhanh và rẻ, mạnh về sử dụng công cụ và thành thật mà nói chỉ ở mức trung bình về lập trình và suy luận thuần túy. Không có chỉ số nào được đo về nó trở nên tệ hơn trong tháng Tám. Điều thay đổi là cấu trúc của gia đình sản phẩm xung quanh nó: Meta hiện có một mô hình đạt điểm cao hơn ở cùng mức giá tiêu chuẩn, một tầng giá rẻ hơn đáng kể dành cho các nhà phát triển sẵn sàng đánh đổi dữ liệu của họ, và một sản phẩm agent không chạy trên 1.1 cũng như không chạy trên bất cứ thứ gì bạn có thể trỏ vào 1.1.
Điều còn lại là một khuyến nghị hẹp hơn nhưng thực sự. Nếu bạn cần chất lượng suy luận của Meta ở tốc độ mà con người có thể cảm nhận được — một giây đến token đầu tiên trong sản xuất, 213 token mỗi giây sau đó — thì 1.1 vẫn là phiên bản nên dùng, và ba điểm chỉ số mà 1.2 thêm vào không đáng để chờ đợi gấp chín lần. Nếu bạn không cần tốc độ đó, thì không còn lý do gì để ở lại. Dù sao thì đó cũng là một chuỗi mô hình, nên lời khuyên trung thực là chạy cả hai trên bộ đánh giá của riêng bạn trong một ngày và để ngân sách độ trễ của bạn quyết định.
So sánh trong bài viết này4
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
