Muse Spark 1.2 so với GPT-5.6 Luna-1
Guides & Insights

Muse Spark 1.2 so với GPT-5.6 Luna: Ba điểm chỉ số cho giá token gấp 4,6 lần

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Artificial Analysis đã chạy cùng một bộ gồm chín bài kiểm tra trên cả hai mô hình này và giữ lại biên nhận. Việc đưa Muse Spark 1.2 qua đó tốn 637,85 USD. Việc đưa GPT-5.6 Luna qua đó tốn 174,06 USD. Với mức chênh lệch chi phí gấp 3,7 lần đó, mô hình của Meta đã vượt lên ba điểm — 54 so với 51 trên Intelligence Index. Liệu đó có phải là một sự đánh đổi tốt hay không chính là toàn bộ câu hỏi, và câu trả lời phụ thuộc ít vào điểm chuẩn hơn là vào hai điều hầu như không ai đề cập đến: cách khung tác nhân của bạn xử lý bộ nhớ đệm lời nhắc, và liệu khối lượng công việc của bạn có bao giờ cần nghe hoặc xem bất cứ thứ gì hay không.

Mọi con số dưới đây đều là một phép đo độc lập của Artificial Analysis, một danh sách API trực tiếp, hoặc dữ liệu telemetry sản xuất của chính OrcaRouter — điều cuối cùng đáng được nêu rõ ngay từ đầu vì nó mâu thuẫn với các số liệu chuẩn theo một cách đầy tính minh họa. Không có gì ở đây là tuyên bố của nhà cung cấp được ngụy trang thành kết quả; ở những chỗ chỉ có nhà cung cấp là nguồn duy nhất, câu văn sẽ nói rõ điều đó.

Tỷ số đang gần hơn so với những gì mức giá thể hiện

Muse Spark 1.2 đạt 54 điểm trên Chỉ số Trí tuệ Phân tích Nhân tạo (Artificial Analysis Intelligence Index) ở mức suy luận xhigh, xếp hạng #13 trong số 185 mô hình so với mức trung vị của nhóm là 32. GPT-5.6 Luna đạt 51 điểm ở chế độ max effort. Mức chênh lệch ba điểm dựa trên tổng hợp của GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience và AA-LCR.

Ba điểm là có thật nhưng nhỏ, và các điểm thành phần hiện có của thế hệ trước cho thấy nó xuất phát từ đâu. Các con số theo từng khía cạnh của Artificial Analysis xếp Muse Spark 1.1 ở chỉ số lập trình 71.3 và chỉ số tác nhân 37.5; GPT-5.6 Luna đạt 71.4 và 45.6. Về lập trình, hai bên hòa nhau, còn Luna vượt trước 8 điểm ở mảng tác nhân — đúng khía cạnh mà Meta đã viết lại mô tả sản phẩm 1.2 để khẳng định. Điểm tổng hợp đã nghiêng về phía Meta 3 điểm. Chưa ai công bố bản phân tích theo từng khía cạnh cho 1.2, vì vậy việc khoảng cách về khả năng tác nhân có thực sự được thu hẹp hay không vẫn chưa được xác minh.

Muse Spark 1.2 vs GPT-5.6 Luna-2

Về giá token hỗn hợp, khoảng cách không hề nhỏ. Tỷ lệ hỗn hợp của Artificial Analysis đưa Muse Spark 1.2 vào mức 0,78 USD mỗi triệu token và GPT-5.6 Luna ở mức 0,17 USD. Giá niêm yết: 1,25 USD đầu vào và 4,25 USD đầu ra cho Muse Spark 1.2, 0,20 USD đầu vào và 1,20 USD đầu ra cho Luna.

Được định giá theo đơn vị công việc thay vì theo token, một bước tác tử mã hóa đọc 60.000 token ngữ cảnh và viết 3.000 token đầu ra có chi phí khoảng 8,8 xu trên Muse Spark 1.2 và khoảng 1,6 xu trên GPT-5.6 Luna. Qua một nghìn bước mỗi ngày, tức là $88 so với $16 — chênh lệch khoảng $26.000 mỗi năm cho một vòng lặp tác tử duy nhất.

Bộ nhớ đệm là nơi khoảng cách thu hẹp hoặc tăng gấp đôi.

Cả hai mô hình đều đưa ra mức giá đầu vào lưu cache rất cạnh tranh, và tỷ lệ giữa chúng không giống với tỷ lệ giữa giá niêm yết của chúng. Muse Spark 1.2 tính phí đọc đầu vào lưu cache là 0,15 đô la mỗi triệu, giảm 88% so với mức giá 1,25 đô la của nó. GPT-5.6 Luna tính phí đọc đầu vào lưu cache là 0,01 đô la mỗi triệu, giảm 95% so với mức giá 0,20 đô la.

Chạy lại cùng bước agent với tiền tố 60.000 token được phục vụ nóng: Muse Spark 1.2 giảm từ 8,8 xu xuống còn khoảng 2,2 xu. Luna giảm từ 1,6 xu xuống còn khoảng 0,4 xu. Khoảng cách tuyệt đối thu hẹp từ 7,2 xu xuống 1,8 xu mỗi bước, nhưng bội số vẫn gần như không đổi — việc lưu cache không cứu được mô hình đắt tiền hơn, nó chỉ làm cả hai rẻ hơn theo các hệ số tương tự. Điều nó thay đổi là khoản mục nào chiếm ưu thế: khi được cache, chi phí của Muse Spark 1.2 là 59% token đầu ra thay vì 85% token đầu vào, do đó tính dài dòng của mô hình bắt đầu quan trọng hơn kích thước ngữ cảnh.

Đó không phải là mối lo ngại giả định ở đây. Muse Spark 1.2 đã tạo 95M token đầu ra khi vượt qua Intelligence Index, so với mức trung vị 65M. Bản tóm tắt của chính Artificial Analysis gọi đây là "hơi dài dòng". Luna đã tiêu tốn 130M, nghe có vẻ tệ hơn cho đến khi bạn nhân với $1.20 thay vì $4.25.

Tài liệu sản phẩm của Meta cho biết bộ nhớ đệm lời nhắc (prompt caching) có thể giảm chi phí hiệu quả từ 60–80% tùy thuộc vào mức độ lặp lại của ngữ cảnh. Đó là ước tính từ nhà cung cấp, không phải phép đo, nhưng phép tính ở trên nằm trong khoảng đó.

Độ trễ: trục mà ở đó benchmark đảo ngược sự thật

Chỉ cần đọc các số liệu độ trễ của Artificial Analysis, bạn sẽ kết luận rằng Muse Spark 1.2 mới là phiên bản phản hồi nhanh. Thời gian đến token đầu tiên: 26,12 giây cho Muse Spark 1.2, 126,99 giây cho GPT-5.6 Luna. Nhanh hơn gần năm lần.

Cả hai con số đó đều được đo ở chế độ suy luận tốn kém nhất của mỗi mô hình — xhigh cho Muse Spark, max cho Luna. Cả hai đều không phải là những gì bạn sẽ thấy. Trên OrcaRouter, trong một tuần lưu lượng thực tế với bất kỳ mức nỗ lực nào mà người gọi thực sự yêu cầu, GPT-5.6 Luna cho thấy thời gian đến token đầu tiên ở phân vị p50 là 1,84 giây và p95 là 9,68 giây. Muse Spark 1.1 cho thấy p50 1,84 giây giống hệt, với p95 chặt chẽ hơn ở mức 6,00 giây. Chưa có dữ liệu telemetry sản xuất nào cho phiên bản 1.2 vì nó quá mới.

Muse Spark 1.2 vs GPT-5.6 Luna-3

Sự khác biệt về cấu trúc hữu ích hơn cả hai con số. Khả năng suy luận của GPT-5.6 Luna là tùy chọn — núm điều chỉnh mức độ nỗ lực chạy từ không qua thấp, trung bình, cao, rất cao đến tối đa, và bạn có thể thực sự tắt suy luận để phân loại, định tuyến hoặc trích xuất. Khả năng suy luận của Muse Spark 1.2 là bắt buộc. Núm điều chỉnh chạm đáy ở mức tối thiểu, và không có cài đặt nào cung cấp cho bạn trọng số mà không phải trả chi phí cho quá trình suy luận. Đối với bất kỳ tác vụ nào có khối lượng lớn và nhạy cảm với độ trễ, đó là một ràng buộc thiết kế, không phải một tham số điều chỉnh.

Thông lượng bền vững là gần nhau: 165.0 token mỗi giây cho Muse Spark 1.2 so với 177.9 cho Luna, cả hai đều cao hơn nhiều so với mức trung vị của nhóm là 71.

Chú thích về giá mà ai cũng sẽ vấp phải

Giá của GPT-5.6 Luna hiện đang được niêm yết khác nhau ở nhiều nơi, và nếu bạn đang xây dựng mô hình chi phí, bạn nên biết điều này trước khi trích dẫn một con số. Danh mục của Artificial Analysis và OrcaRouter đều hiển thị $0.20 cho mỗi triệu token đầu vào và $1.20 cho mỗi triệu token đầu ra — mức giá được áp dụng sau đợt cắt giảm giá GPT-5.6 vào tháng 7, và cũng là mức giá Artificial Analysis đã sử dụng để tính hóa đơn đánh giá $174.06 ở trên. Một số danh sách trên chợ ứng dụng hiện hiển thị $0.10 và $0.60 với một bậc giá cao hơn riêng biệt áp dụng khi vượt quá 272,000 token prompt. Cách an toàn là kiểm tra giá trên endpoint bạn thực sự đang gọi thay vì mức giá trong bài viết so sánh.

Chi tiết phân tầng giá là có thật bất kể mức giá cơ sở nào được áp dụng, và nó thực sự chưa được đề cập đúng mức: Giá của Luna tăng lên khi một yêu cầu duy nhất vượt quá khoảng 272.000 token đầu vào. Giá đầu vào tăng gần gấp đôi, giá đầu ra tăng thêm một nửa, và lượt đọc từ bộ nhớ đệm cũng tăng theo tỷ lệ tương ứng. Nếu lý do bạn quan tâm đến Luna là cửa sổ ngữ cảnh 1,05 triệu token của nó, hãy lưu ý rằng bạn sẽ rời khỏi mức giá niêm yết khi mới đi được khoảng một phần tư quãng đường. Muse Spark 1.2 có mức giá đồng nhất cho toàn bộ 1.048.576 token mà không có phụ phí ngữ cảnh dài — đối với các yêu cầu đơn lẻ thực sự dài, khoảng cách hiệu quả giữa hai bên thu hẹp đáng kể.

Những điều Luna không thể làm dù bằng bất kỳ giá nào

Sự khác biệt về phương thức là lý do rõ ràng nhất để chọn cái này thay vì cái kia, và nó không xuất hiện trên bất kỳ bảng xếp hạng nào.

Đầu vào — Muse Spark 1.2 chấp nhận văn bản, hình ảnh, video, âm thanh và tài liệu PDF theo danh sách của Meta. GPT-5.6 Luna chấp nhận văn bản, hình ảnh và tệp tin. Không có âm thanh, không có video. Nếu quy trình xử lý của bạn liên quan đến bản ghi âm hoặc cảnh quay, Luna hoàn toàn không phải là ứng viên phù hợp.

Đầu ra tối đa — Luna công bố giới hạn hoàn thành 128.000 token. Endpoint của Muse Spark 1.2 tuyên bố không có độ dài hoàn thành tối đa, điều này đủ bất thường đến mức bạn nên kiểm thử nó thay vì lên kế hoạch xoay quanh nó.

Thời điểm cắt kiến thức — của Luna được công bố là ngày 16 tháng 2 năm 2026. Meta không công bố thời điểm cắt kiến thức cho Muse Spark 1.2, vì vậy hãy dự trù ngân sách cho việc truy xuất trong cả hai trường hợp.

Phục vụ — Luna khả dụng rộng rãi trên toàn thế giới thông qua nhiều tuyến. Muse Spark 1.2 được phục vụ bởi đúng một nhà cung cấp: Meta. Một điểm cuối, một chính sách khu vực, một thứ có thể sập.

Kiểm duyệt — cả hai đều là các điểm cuối được kiểm duyệt.

Một lưu ý thẳng thắn về lợi thế đa phương thức: Thẻ thông số kỹ thuật của Artificial Analysis cho Muse Spark 1.2 chỉ liệt kê đầu vào văn bản và hình ảnh như những gì họ đã đánh giá, chứ không phải toàn bộ bề mặt năm phương thức mà Meta quảng cáo. API chấp nhận nhiều hơn những gì bất kỳ ai độc lập đã thử nghiệm.

Muse Spark 1.2 vs GPT-5.6 Luna-4

Sự áp dụng, vì nó có thể đo lường được

Điểm chuẩn cho biết mô hình có thể làm gì; lưu lượng sử dụng cho biết người ta tin tưởng giao cho nó những việc gì. Trong một tuần trượt trên OrcaRouter, GPT-5.6 Luna đã định tuyến 4.679,4 triệu token. Muse Spark 1.1 — cùng ngữ cảnh 1M, chỉ số tương đương, đã có mặt trong danh mục lâu hơn bốn tuần — đã định tuyến 4,4 triệu. Tức là gấp khoảng một nghìn lần.

Một phần điều đó là do phân phối: Luna là lựa chọn mặc định trong nhiều công cụ hơn và đã GA toàn cầu lâu hơn, trong khi dòng Muse Spark chỉ phát hành tại Mỹ. Nhưng khoảng cách một nghìn trên một trên một router nơi cả hai chỉ cách nhau một chuỗi tên model thì không hẳn là chuyện phân phối. Đó là lý do thực tế Luna là lựa chọn mặc định an toàn hơn và Muse Spark 1.2 là thứ bạn cần đánh giá một cách có chủ đích.

Đáng lưu ý {{1}}những gì bạn có thể và không thể thuê hôm nay{{/1}}: GPT-5.6 Luna nằm trong danh mục OrcaRouter với giá $0.20 và $1.20, {{2}}cùng những con số trên bảng giá của chính nhà cung cấp{{/2}}, vì chúng tôi áp dụng mức tăng 0% và chuyển thẳng giá niêm yết của nhà cung cấp. Muse Spark 1.1 hiện diện ở đó với giá $1.25 và $4.25 {{3}}trên cùng cơ sở đó{{/3}}. Muse Spark 1.2 chưa có trong danh mục — nó được Meta phục vụ trực tiếp. {{4}}Vì vậy, cách rẻ nhất để chạy so sánh này một cách trung thực hôm nay là{{/4}} dùng Luna đối đầu Muse Spark 1.1 trên một key, thay đổi một chuỗi giữa các lần chạy, {{5}}rồi kiểm tra lại với 1.2 khi nó ra mắt{{/5}}.

Chọn một.

Hãy dùng GPT-5.6 Luna nếu khối lượng công việc lớn và có dạng văn bản: chat, phân loại, trích xuất, định tuyến, sử dụng công cụ nhẹ. Giá của nó chỉ bằng một phần tư mức giá trung bình, cho phép tắt hoàn toàn khả năng suy luận, p50 1,84 giây là con số sản xuất thực tế được đo đạc chứ không phải kết quả giả tạo của benchmark, và đây là mô hình có lưu lượng truy cập thực tế gấp nghìn lần phía sau. Ba điểm chỉ số không thể trụ vững trước phép tính đó.

Hãy dùng Muse Spark 1.2 nếu khối lượng công việc là mã hóa tác nhân dài hạn — tái cấu trúc nhiều tệp, gỡ lỗi kéo dài, làm việc trên toàn bộ kho lưu trữ — hoặc nếu nó liên quan đến đầu vào âm thanh hoặc video, nơi Luna hoàn toàn không thể cạnh tranh. Đây cũng là lựa chọn tốt hơn cho các yêu cầu đơn lẻ thực sự khổng lồ, vì mức giá của nó cố định trên toàn bộ triệu token trong khi mức giá của Luna tăng theo bậc sau 272K.

Dùng cả hai nếu bạn thành thật về cách các hệ thống agent thực sự được xây dựng. Mẫu hình chiến thắng liên tục là một mô hình giá rẻ xử lý phần lớn các cuộc gọi thông thường và một mô hình đắt tiền dành riêng cho các bước mà chất lượng tự bù đắp chi phí. Cả hai mô hình nằm sau một endpoint tương thích OpenAI, nên sự phân chia đó là một quy tắc định tuyến chứ không phải mối quan hệ với nhà cung cấp thứ hai — và nếu nhánh đắt tiền gặp sự cố giữa chừng, chuyển đổi dự phòng tự động đảm bảo quá trình đánh giá của bạn không âm thầm tự đầu độc với một nửa tập dữ liệu.

Điều cần theo dõi trong tháng tới là bảng phân tích theo từng khía cạnh. Toàn bộ điểm nhấn của Muse Spark 1.2 là khả năng tác nhân, và ở thế hệ trước, đó chính là khía cạnh mà Luna dẫn trước tám điểm. Cho đến khi ai đó công bố chỉ số tác nhân cho bản 1.2, mức tăng tổng hợp ba điểm là bằng chứng duy nhất cho thấy Meta đã thu hẹp khoảng cách đó.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube