Muse Spark 1.2 là mô hình lập luận của Meta cho các tác vụ agentic phức tạp, và là checkpoint hiện tại của dòng Muse Spark. Meta mô tả đây là một checkpoint cập nhật so với Muse Spark 1.1 với hiệu suất cao hơn một chút, được phục vụ trên cùng tầng Standard với mức giá giống hệt — một bản nâng cấp thay thế trực tiếp chứ không phải một tầng mới. Nó chấp nhận một bề mặt đầu vào rộng bất thường — văn bản, hình ảnh, video, âm thanh và tài liệu PDF — và trả về văn bản, lập luận một cách tự nhiên trên các phương thức trong một cửa sổ ngữ cảnh 1 triệu token. Nó hỗ trợ mức độ lập luận có thể cấu hình, gọi công cụ gốc và đầu ra có cấu trúc, khiến nó rất phù hợp cho các tác nhân đa phương thức, nghiên cứu sâu trên phương tiện hỗn hợp và phân tích ngữ cảnh dài. Muse Spark 1.2 nhắm đến các khối lượng công việc kết hợp tài liệu, ảnh chụp màn hình, bản ghi âm và video với văn bản — từ phân tích các báo cáo dài và thư viện phương tiện đến điều khiển các pipeline agentic nhiều bước phải lập luận không chỉ về văn bản. Meta cũng phát hành muse-spark-1.2-contributor, cùng checkpoint đó trên tầng Contributor.
Muse Spark 1.2 là mô hình ngôn ngữ do Meta sản xuất, được phục vụ thông qua OrcaRouter. Mô hình này chấp nhận đầu vào dạng văn bản, hình ảnh, video, tệp và âm thanh, đồng thời tạo ra đầu ra dạng văn…
Dựa trên các dữ kiện được cung cấp, Muse Spark 1.2 có thể tiếp nhận văn bản, hình ảnh, video, tệp và âm thanh, đồng thời phản hồi bằng văn bản. Do đó, mô hình phù hợp cho các tác vụ hiểu đa phương thức như tóm tắt, trích xuất, dịch nội dung âm thanh và trả lời câu hỏi về tài liệu hình ảnh hoặc âm thanh. Cửa sổ ngữ cảnh 1.048.576 token cho phép mô hình sử dụng một lượng lớn tài liệu nguồn làm ngữ cảnh. Tất cả các phương thức đầu vào đều được tính vào cùng một hạn mức token. Không có thông tin nào trong siêu dữ liệu được cung cấp về các khả năng đặc biệt như gọi công cụ, đầu ra có cấu trúc hoặc tinh chỉnh. OrcaRouter cung cấp mô hình thông qua API chuẩn, do đó mọi khả năng mà API hiển thị đều có thể được sử dụng. Đối với bất kỳ điều gì không được đề cập trong thẻ mô hình, hãy kiểm tra mô hình bằng prompt và payload của riêng bạn trước khi đưa vào sản xuất.
Các trường hợp sử dụng tốt nhất đến từ sự kết hợp giữa đầu vào đa phương thức và ngữ cảnh lớn. Bạn có thể đặt câu hỏi về một video dài, tóm tắt bản ghi âm, xem xét hình ảnh cùng với văn bản hỗ trợ, hoặc làm việc với tệp đính kèm trong cùng một cuộc trò chuyện. Cửa sổ ngữ cảnh 1.048.576 token cũng hỗ trợ các tài liệu dài và kho ngữ liệu nhiều tệp. Hãy sử dụng Muse Spark 1.2 khi một tác vụ nếu không sẽ cần nhiều mô hình hoặc nhiều lệnh gọi chia nhỏ. Nếu đầu vào chủ yếu là văn bản và ngắn, một mô hình rẻ hơn có thể mang lại giá trị tốt hơn. OrcaRouter tính phí theo giá của nhà cung cấp, vì vậy chi phí tương ứng với số token bạn gửi. Để giữ chi phí ở mức quản lý được, hãy lọc trước nội dung và chỉ gửi các phần liên quan của tệp, hình ảnh hoặc âm thanh. Mô hình này không được thiết kế để tạo phương tiện; đầu ra của nó là văn bản.
Muse Spark 1.2 được định vị là một mô hình đa phương thức ngữ cảnh cao. Đối với các truy vấn chỉ có văn bản ngắn, một mô hình nhỏ hơn thường sẽ nhanh hơn và ít tốn kém hơn. Mức giá được cung cấp là $4.25 cho mỗi 1 triệu token đầu ra là một mức giá cao cấp so với nhiều mô hình văn bản nhẹ, mặc dù việc so sánh chính xác phụ thuộc vào các lựa chọn thay thế. Không có hạn mức token cụ thể hoặc số liệu điểm chuẩn nào trong các dữ kiện được cung cấp, vì vậy quyết định dựa trên độ phức tạp của tác vụ. Nếu nội dung của bạn là văn bản thuần túy dưới vài nghìn token, hãy sử dụng mô hình rẻ hơn. Nếu tác vụ của bạn liên quan đến âm thanh dài, video, hình ảnh hoặc tệp tin, thì hỗ trợ đầu vào đa phương thức và ngữ cảnh 1M có thể biện minh cho mức giá. OrcaRouter cho phép bạn chuyển đổi mô hình bằng cách thay đổi tham số model, vì vậy bạn có thể định tuyến các tác vụ đơn giản đến mô hình rẻ hơn và dành Muse Spark 1.2 cho các tác vụ đa phương thức khó hơn.
Mô hình xuất ra văn bản. Mô hình không tạo ra hình ảnh, video hoặc âm thanh. Mô hình chấp nhận các loại phương tiện này làm đầu vào, nhưng phản hồi là một đoạn văn bản hoàn thiện. Không có giới hạn token đầu ra nào được nêu trong siêu dữ liệu được cung cấp, nhưng các cài đặt API tiêu chuẩn như max_tokens có thể giới hạn độ dài của phản hồi. Vì không có số liệu benchmark nào được cung cấp, các tuyên bố về độ chính xác và khả năng nên được xác minh bằng dữ liệu của riêng bạn. Mô hình có thể không xử lý được các video cực dài nếu biểu diễn vượt quá cửa sổ ngữ cảnh 1,048,576 token. Mô hình cũng không được đảm bảo hoạt động tốt trên các tác vụ ngoài phạm vi hiểu đa phương thức dự kiến. Khi sử dụng OrcaRouter, API trả về lỗi cho các yêu cầu vượt quá ngân sách ngữ cảnh hoặc vi phạm các ràng buộc đầu vào của nhà cung cấp.
Các dữ kiện mô hình được cung cấp không bao gồm bất kỳ điểm số benchmark hoặc bảng đánh giá nào cho Muse Spark 1.2. Điều này không có nghĩa là mô hình chưa được kiểm thử; mà là siêu dữ liệu được cung cấp cho mục danh mục này không liệt kê các con số đó. Để đánh giá mô hình, hãy tự chạy các ví dụ kiểm thử của bạn và so sánh đầu ra trên các chỉ số theo tác vụ cụ thể. OrcaRouter không công bố kết quả benchmark cho các mô hình của bên thứ ba trong mục này. Khi không có dữ liệu benchmark, người đọc nên dựa vào các khả năng định tính như cửa sổ ngữ cảnh 1.048.576 token và hỗ trợ đầu vào đa phương thức. Mọi con số hiệu suất bạn thấy ở nơi khác phải đến trực tiếp từ Meta hoặc từ các đánh giá độc lập. Cụm từ Muse Spark 1.2 không nên được gắn với các tuyên bố benchmark cụ thể tại đây. Nếu bạn cần một thước đo chất lượng định lượng, hãy thiết kế một bộ đánh giá nhỏ bao phủ các loại đầu vào bạn dự kiến, bao gồm văn bản, hình ảnh, video, tệp và âm thanh. Đo độ chính xác của tác vụ, tính nhất quán của đầu ra và chi phí. Việc thiếu các benchmark được công bố cũng nhấn mạnh nhu cầu kiểm thử trước khi triển khai vào sản xuất.
Cửa sổ ngữ cảnh là 1.048.576 token. Đây là kích thước đầu vào tối đa mà mô hình có thể xử lý trong một lần gọi, như đã nêu trong các dữ kiện được cung cấp. Token là một đơn vị xử lý văn bản; 1.048.576 token tương đương với một khối lượng dữ liệu văn bản khá lớn, mặc dù số từ chính xác trong mỗi token có thể khác nhau. Giới hạn ngữ cảnh này cũng áp dụng cho nội dung lấy từ video, hình ảnh, tệp và đầu vào âm thanh sau khi chúng được chuyển đổi thành token. Ngữ cảnh lớn cho phép mô hình xem toàn bộ tài liệu, bản ghi dài hoặc nhiều tệp nguồn mà không cần chia nhỏ. Điều này cũng có nghĩa là bạn phải chú ý đến việc sử dụng token khi tải lên tệp phương tiện. Nếu tổng số token của một yêu cầu vượt quá cửa sổ ngữ cảnh, lời gọi API sẽ thất bại. Hãy sử dụng các công cụ đếm token của OrcaRouter hoặc ước tính của riêng bạn để nằm trong giới hạn.
Không có số liệu về độ trễ hay thông lượng nào được bao gồm trong siêu dữ liệu được cung cấp. Thời gian phản hồi thực tế phụ thuộc vào nhiều biến số: tổng độ dài đầu vào, số lượng phương thức, độ phức tạp của lời nhắc và tải phía nhà cung cấp. Một yêu cầu liên quan đến video và âm thanh có thể chậm hơn yêu cầu chỉ có văn bản vì dữ liệu liên quan phải được xử lý trước khi suy luận. Độ dài đầu ra cũng ảnh hưởng đến thời gian; tạo ra nhiều token sẽ mất nhiều thời gian hơn so với tạo ra ít token. Không có mức tốc độ hay mức độ khả dụng được đảm bảo nào được nêu cho mô hình này. Để có được phép đo độ trễ đáng tin cậy, hãy đo điểm chuẩn API thông qua OrcaRouter với các yêu cầu đại diện. Nếu bạn cần độ trễ cực thấp cho các lời nhắc đơn giản, hãy sử dụng mô hình nhỏ hơn. Đối với xử lý đa phương thức ngữ cảnh dài, độ trễ có khả năng cao hơn do bản chất của khối lượng công việc.
OrcaRouter tính phí Muse Spark 1.2 với giá $1.25 cho mỗi 1.000.000 token đầu vào và $4.25 cho mỗi 1.000.000 token đầu ra. Các con số này đến từ các dữ kiện được cung cấp và được truyền thẳng theo giá nhà cung cấp, không có phụ phí nào. Token đầu vào là token do khách hàng gửi, bao gồm văn bản, nội dung tệp và mọi biểu diễn hình ảnh, video hoặc âm thanh. Token đầu ra là token được trả về trong văn bản đã sinh. Do đó, tổng chi phí của một lần gọi là token đầu vào nhân $1.25/1M cộng với token đầu ra nhân $4.25/1M. Vì OrcaRouter không thêm phụ phí, đây là mức giá theo từng hạng mục bạn nên dùng để lập ngân sách. Cửa sổ ngữ cảnh là 1.048.576 token, vì vậy một lần nhập đầy đủ ngữ cảnh sẽ có chi phí cao hơn một chút so với $1.25 theo mức giá đầu vào. Ước tính đó giả định chính xác số token đầu vào tối đa; các yêu cầu thực tế có thể khác.
Token đầu vào có giá 1,25 đô la mỗi triệu. Token đầu ra có giá 4,25 đô la mỗi triệu. Token đầu ra được định giá cao hơn token đầu vào, điều này phổ biến đối với các mô hình tạo sinh. Đối với nhiều tác vụ, đầu ra là một đoạn hoàn thành ngắn trong khi đầu vào chứa một lượng lớn tài liệu nguồn. Trong trường hợp đó, chi phí token đầu vào chiếm ưu thế. Ngược lại, nếu bạn yêu cầu tạo một văn bản dài, chi phí đầu ra có thể trở nên đáng kể. Vì cửa sổ ngữ cảnh là 1,048,576 token, bạn có thể gửi dữ liệu gần đến giới hạn đó và phát sinh chi phí đầu vào. Bạn có thể giảm chi phí đầu vào bằng cách chỉ gửi các phần liên quan của tệp, giới hạn độ dài video hoặc âm thanh và cắt bớt lịch sử hội thoại. OrcaRouter không cộng thêm phụ phí, vì vậy mọi khác biệt về chi phí đều đến từ khối lượng sử dụng và lựa chọn của bạn.
Các dữ kiện được cung cấp không bao gồm bất kỳ thông tin định giá bộ nhớ đệm hoặc chiết khấu nào cho Muse Spark 1.2. Một số nhà cung cấp đưa ra mức giá thấp hơn cho các token đầu vào được lưu trong bộ nhớ đệm, nhưng không có số liệu nào như vậy được liệt kê ở đây. Nếu OrcaRouter hoặc Meta kích hoạt bộ nhớ đệm lời nhắc (prompt caching) cho mô hình này, mức giá bộ nhớ đệm hiện có sẽ được ghi chú riêng. Nếu không có tài liệu đó, hãy giả định rằng mọi token đầu vào đều bị tính phí ở mức $1,25 đầy đủ cho mỗi triệu token. Đừng lên kế hoạch ngân sách dựa trên khoản tiết kiệm từ bộ nhớ đệm trừ khi bạn đã xác nhận các điều khoản hiện tại. Bộ nhớ đệm cũng phụ thuộc vào việc sử dụng lại lời nhắc; các yêu cầu có dữ liệu đầu vào duy nhất hoặc thay đổi nhiều sẽ không được hưởng lợi. Hãy kiểm tra trang định giá của OrcaRouter hoặc liên hệ bộ phận hỗ trợ để xem có mức giá bộ nhớ đệm nào cho meta/muse-spark-1.2 hay không.
OrcaRouter tuyên bố rằng Muse Spark 1.2 được tính phí theo mức giá của nhà cung cấp mà không có phụ phí. Điều đó có nghĩa là giá bạn trả cho mỗi token khớp với mức giá niêm yết của nhà cung cấp: $1.25 cho mỗi 1M token đầu vào và $4.25 cho mỗi 1M token đầu ra. OrcaRouter không cộng thêm phí theo token hoặc phí dịch vụ vào mức giá này. Mức giá không phụ phí giúp đơn giản hóa việc dự toán chi phí vì dòng hóa đơn của bạn khớp với giá niêm yết của mô hình. Điều này không có nghĩa là không có phí đăng ký hoặc phí hạ tầng cơ bản nếu OrcaRouter thu phí đó cho tài khoản API; các dữ kiện được cung cấp chỉ mô tả việc tính phí theo từng token. Luôn kiểm tra gói OrcaRouter của bạn để biết bất kỳ chi phí cố định nào. Việc không phụ phí áp dụng cho mức giá của mô hình và là cơ sở để so sánh chi phí với các mô hình khác.
Để gọi Muse Spark 1.2 thông qua OrcaRouter, hãy đặt base URL thành https://api.orcarouter.ai/v1 và sử dụng model id meta/muse-spark-1.2. Máy khách của bạn nên gửi một yêu cầu tuân theo định dạng chat completion tương thích với OpenAI. Bao gồm khóa API OrcaRouter trong header Authorization. Mảng messages có thể chứa nội dung bạn muốn xử lý. Đối với đầu vào đa phương thức, định dạng nội dung cho hình ảnh, video, tệp và âm thanh phụ thuộc vào lược đồ được OrcaRouter hỗ trợ; giao diện tương thích với OpenAI thường cho phép các phần nội dung. Tên trường chính xác được ghi trong tài liệu tham khảo API. Đảm bảo tổng số token của yêu cầu nằm trong cửa sổ ngữ cảnh 1.048.576 token. Nếu bạn sử dụng OpenAI SDK, hãy đặt các tham số base_url và model cho phù hợp.
OrcaRouter cung cấp một API tương thích với OpenAI, vì vậy các tham số suy luận chuẩn như temperature, top_p, max_tokens và chuỗi dừng có thể được hỗ trợ. Vì đây là các tham số API chung của OpenAI, hành vi của chúng tuân theo đặc tả API. Các dữ kiện được cung cấp không liệt kê các tham số dành riêng cho mô hình Muse Spark 1.2. Bạn cũng có thể truyền system message, user messages và assistant messages như một phần của hội thoại. Đối với đầu vào đa phương thức, định dạng yêu cầu phải bao gồm các phần nội dung chính xác cho phương tiện được đính kèm. Không có gì đảm bảo rằng mọi tham số OpenAI đều được mọi nhà cung cấp hỗ trợ, vì vậy hãy kiểm tra từng tham số khi bạn di chuyển. Sử dụng chính xác ID mô hình meta/muse-spark-1.2. Nếu một tham số không được hỗ trợ, OrcaRouter sẽ trả về thông báo lỗi; hãy đối chiếu với tài liệu API.
Để di chuyển tích hợp tương thích OpenAI hiện có sang OrcaRouter, hãy thay đổi URL gốc từ điểm cuối hiện tại của bạn thành https://api.orcarouter.ai/v1 và đặt model thành meta/muse-spark-1.2. Giữ nguyên cấu trúc message nếu bạn đang sử dụng chuẩn OpenAI chat completions. Thay khóa API của bạn bằng khóa OrcaRouter. Nếu các yêu cầu hiện tại của bạn bao gồm các phần mở rộng riêng của model, hãy xóa hoặc điều chỉnh chúng dựa trên tài liệu API của OrcaRouter. Cửa sổ ngữ cảnh là 1.048.576 token, có thể lớn hơn model trước đây của bạn, cho phép cùng một yêu cầu vừa vặn mà không bị cắt bớt. Kiểm tra định dạng đầu vào của bạn cho hình ảnh, video, tệp và âm thanh nếu bạn đã sử dụng các trường riêng của nhà cung cấp. Hãy thử nghiệm với một yêu cầu nhỏ trước tiên. Vì Muse Spark 1.2 xuất ra văn bản, việc di chuyển rất đơn giản đối với các công cụ dựa trên văn bản.
Các thông tin mô hình được cung cấp không bao gồm các điều khoản về xử lý dữ liệu, lưu trữ hoặc quyền riêng tư cho Muse Spark 1.2 hoặc OrcaRouter. Nói chung, các yêu cầu được gửi đến nhà cung cấp mô hình để tạo ra các phản hồi (completions). OrcaRouter có thể lưu trữ nhật ký API hoặc dữ liệu sử dụng cho mục đích vận hành, nhưng chính sách cụ thể không được mô tả tại đây. Nếu quyền riêng tư dữ liệu là vấn đề quan trọng, hãy xem xét các điều khoản dịch vụ và chính sách bảo mật của OrcaRouter, đồng thời xác nhận xem các điều khoản nhà cung cấp của Meta có áp dụng cho nội dung bạn gửi hay không. Không giả định rằng video, âm thanh hoặc tệp đầu vào sẽ tự động bị xóa sau khi suy luận (inference). Đối với dữ liệu bí mật, hãy cân nhắc việc biên tập (redaction) và tiền xử lý cục bộ. Phần này không nên được hiểu là tư vấn pháp lý. Liên hệ với bộ phận hỗ trợ của OrcaRouter để nhận được thỏa thuận xử lý dữ liệu hiện tại. Việc bạn sử dụng API đồng nghĩa với việc đồng ý với các điều khoản áp dụng.
Muse Spark 1.2 khác với các mô hình ngôn ngữ chỉ xử lý văn bản vì nó chấp nhận đầu vào là hình ảnh, video, tệp và âm thanh. Mô hình chỉ xử lý văn bản chỉ có thể xử lý nội dung dạng chữ viết. Đối với các tác vụ đa phương thức, Muse Spark 1.2 loại bỏ nhu cầu trích xuất và phiên âm phương tiện trước khi gọi LLM. Cửa sổ ngữ cảnh 1.048.576 token của nó cũng cho phép giữ đầu vào dài hơn nhiều so với nhiều mô hình tiêu chuẩn. Mặt khác, các mô hình chỉ xử lý văn bản thường rẻ hơn và có thể thực thi nhanh hơn cho công việc thuần văn bản. Giá đầu ra $4.25 mỗi triệu token cao hơn nhiều mô hình văn bản nhẹ. Nếu dự án của bạn hoàn toàn là văn bản và không cần ngữ cảnh dài, mô hình chỉ xử lý văn bản có thể phù hợp hơn. Nếu quy trình làm việc của bạn đã gửi hình ảnh, âm thanh hoặc video, mô hình này mang lại một đường dẫn gọi duy nhất.
Các mô hình chỉ xử lý âm thanh và chỉ xử lý hình ảnh thường chuyên sâu vào một phương thức duy nhất và có thể xuất ra nhãn, embedding hoặc bản phiên âm. Muse Spark 1.2 hợp nhất văn bản, hình ảnh, video, tệp tin và âm thanh trong một giao diện tạo văn bản duy nhất. Điều này có thể đơn giản hóa các quy trình trước đây phải kết hợp một bộ phiên âm âm thanh, một bộ mô tả hình ảnh và một LLM. Tuy nhiên, các mô hình chuyên dụng có thể được tinh chỉnh tốt hơn cho các tác vụ như nhận dạng giọng nói hoặc phát hiện đối tượng. Không có điểm chuẩn nào được cung cấp cho Muse Spark 1.2, vì vậy không có dữ liệu ở đây để so sánh với các mô hình chuyên dụng. Lựa chọn phù hợp phụ thuộc vào việc bạn cần hiểu biết tổng quát hay độ chính xác chuyên biệt. Đối với suy luận tổng quát trên nhiều phương thức, một mô hình đa phương thức duy nhất có thể dễ bảo trì hơn. Đối với độ chính xác nghiêm ngặt trong sản xuất trên một loại phương tiện, hãy thử nghiệm các giải pháp thay thế chuyên dụng.
Các số liệu giá duy nhất được cung cấp cho Muse Spark 1.2 là $1,25 cho mỗi 1 triệu token đầu vào và $4,25 cho mỗi 1 triệu token đầu ra, được tính phí không tăng giá thông qua OrcaRouter. Việc so sánh với các mô hình khác sẽ cần có bảng giá của chúng, bảng giá này không nằm trong phần này. Nhìn chung, các mô hình đa phương thức chi phí vận hành cao hơn so với các mô hình văn bản đơn giản vì chúng xử lý dữ liệu đầu vào phong phú hơn. Cửa sổ ngữ cảnh 1.048.576 token có thể làm tăng chi phí nếu bạn gửi một lượng lớn phương tiện. Đối với một lời nhắc văn bản ngắn, chi phí đầu vào rất nhỏ. Đối với một yêu cầu có vài phút video và đầu ra dài, chi phí sẽ cao hơn. Hãy sử dụng mức giá trên mỗi token và số lượng token dự kiến của bạn để ước tính liệu một mô hình thay thế có tiết kiệm hơn hay không. Vì OrcaRouter không thêm phụ phí, mức giá của nhà cung cấp là chuẩn so sánh phù hợp.
Tương thích OpenAI — giữ nguyên SDK bạn đang dùng
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="meta/muse-spark-1.2",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortrepetition_penaltyresponse_formatstructured_outputstemperaturetool_choicetoolstop_ktop_p| Đầu vào / 1M tokens | $1.25 |
| Đầu ra / 1M tokens | $4.25 |
| Đọc cache / 1M | $0.150 |
| Tiền tệ | USD |
Ước tính theo giá niêm yết
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
Điều các nhà phát triển đang nói tuần này
GET /api/public/models/meta/muse-spark-1.2Mở @misc{orcarouter_muse_spark_1_2,
title = {Muse Spark 1.2 API},
author = {Meta},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/meta/muse-spark-1.2}
}Meta. (2026). Muse Spark 1.2 API. OrcaRouter. https://www.orcarouter.ai/models/meta/muse-spark-1.2