Muse Spark 1.2 so với Claude Fable 5
Guides & Insights

Muse Spark 1.2 so với Claude Fable 5: Sáu điểm chỉ số thực sự có giá bao nhiêu?

Tác giả

Jim Song

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Artificial Analysis công bố điều mà hầu hết các bảng benchmark bỏ qua: chi phí đã bỏ ra. Việc chạy Chỉ số Trí tuệ gồm chín bài đánh giá tốn $637.85 cho Muse Spark 1.2$5,630.52 cho Claude Fable 5. Cùng một bộ benchmark, cùng một khung kiểm thử, nhưng một hóa đơn gấp 8,8 lần hóa đơn kia. Fable 5 đạt 60 so với 54 của Muse Spark 1.2.

Chia chênh lệch đó ra, bạn sẽ có được con số mà sự so sánh này thực sự nói đến: với khối lượng công việc đó, sáu điểm thông minh cuối cùng có giá khoảng $832 mỗi điểm. Có nên trả mức giá đó hay không không phải là câu hỏi về benchmark. Đó là câu hỏi về việc bao nhiêu phần lưu lượng truy cập của bạn thực sự cần những điểm đó, và câu trả lời cho hầu hết các nhóm là một phần nhỏ và có thể xác định được.

Điểm chỉ số cận biên có một cái giá, và nó rất đắt.

Cả hai số liệu đều đến từ cùng một tổ chức đánh giá độc lập chạy cùng một bộ tổng hợp — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience và AA-LCR. Cả hai đều không phải là tuyên bố từ nhà cung cấp. Fable 5 đứng ở vị trí #3 trong số 185 mô hình; Muse Spark 1.2 ở vị trí #13, so với mức trung vị của nhóm là 32. Cả hai đều vượt xa mức trung bình; chỉ một mô hình ở trình độ tiên phong.

Muse Spark 1.2 vs Claude Fable 5

Giá niêm yết giải thích phần lớn khoảng cách và đánh giá thấp phần còn lại:

Đầu vào — Muse Spark 1.2 $1,25 mỗi triệu, Claude Fable 5 $10,00. Gấp tám lần.

Đầu ra — $4.25 so với $50.00. Gần mười hai lần.

Đầu vào đã lưu cache — $0.15 so với $1.00. Gần gấp bảy lần, và Fable 5 còn tính thêm $12.50 mỗi triệu lần ghi cache, hoặc $20.00 cho TTL một giờ, trong khi Muse Spark 1.2 không công bố bất kỳ khoản phí ghi cache riêng nào.

Tỷ lệ kết hợp — Artificial Analysis định giá Muse Spark 1.2 ở mức $0.78 mỗi triệu token và Fable 5 ở mức $7.70. Chưa đến mười lần.

Khi mới ra mắt, Fable 5 là mô hình đắt nhất mà Artificial Analysis từng đánh giá, và nó vẫn giữ vị trí đó. Cần phải nói chính xác lý do: mô hình đã tiêu thụ ít hơn token đầu ra so với Muse Spark 1.2 khi hoàn thành bảng chỉ số — 87M so với 95M — vì vậy toàn bộ chênh lệch chi phí là do đơn giá, không phải do mức độ dài dòng. Fable 5 không lãng phí. Nó chỉ đơn giản được định giá như một sản phẩm hàng đầu.

Quy đổi ra một bước tác tử đọc 60.000 token ngữ cảnh kho lưu trữ và viết 3.000 token bản vá: khoảng 8,8 xu trên Muse Spark 1.2, khoảng 75 xu trên Claude Fable 5. Một nghìn bước mỗi ngày là 88 đô la so với 750 đô la. Trong một năm, 32.000 đô la so với 274.000 đô la.

Nơi Claude Fable 5 không thể thay thế

Trường hợp chi phí sẽ chỉ là một chiều nếu sáu điểm đó là toàn bộ sự khác biệt. Chúng không phải vậy, và nơi khoảng cách nới rộng chính là nơi Meta đã định vị lại Muse Spark 1.2 để cạnh tranh.

Fable 5 giữ vị trí đầu tiên trên nhiều bảng xếp hạng đối đầu của Design Arena: 1399 Elo và hạng 1 trong phát triển trò chơi, 1367 và hạng 1 trong nghệ thuật ASCII, 1353 và hạng 1 trong tạo SVG, cùng hạng 1 trong đấu trường agent cho phát triển trò chơi Godot (1344), Android native (1318), phát triển trò chơi agentic (1300) và HTML slides (1260), và xếp thứ hai trong các ứng dụng web và công việc full-stack. Muse Spark 1.2 không có bất kỳ mục nào trong Design Arena — phiên bản tiền nhiệm của nó đã tích lũy thành tích đáng nể ở khu vực giữa bảng xếp hạng (1334 trong phát triển trò chơi ở hạng 5, 1309 trong các hạng mục code nói chung ở hạng 9), nhưng phiên bản mới chưa được xếp hạng lần nào.

Các chỉ số theo từng chiều cũng chỉ cùng một hướng. Artificial Analysis chấm Claude Fable 5 với chỉ số lập trình 76.5 và chỉ số agentic 52.8. Muse Spark 1.1 đứng ở 71.3 và 37.5 — kém năm điểm về lập trình và kém mười lăm điểm về mảng agentic. Chưa có số liệu theo từng chiều nào cho 1.2 được công bố, nên phát biểu trung thực là chúng ta biết điểm tổng hợp đã tiến gần hơn ba điểm, nhưng không biết bao nhiêu trong số đó thuộc về trục agentic.

Muse Spark 1.2 vs Claude Fable 5

Định vị sản phẩm của chính Fable 5 tuyên bố rằng khoảng cách dẫn đầu mở rộng theo độ dài và độ phức tạp của nhiệm vụ. Đây là tuyên bố của nhà cung cấp và chưa được kiểm chứng như đã nêu, nhưng nó phù hợp với hình dạng của dữ liệu độc lập: khoảng cách lớn nhất của Fable 5 nằm ở đấu trường agent, nơi một mô hình phải giữ vững một kế hoạch qua nhiều lượt, thay vì trong tạo sinh một lần duy nhất.

Nơi Muse Spark 1.2 đơn giản là câu trả lời đúng

Ba điều khiến nó trở thành lựa chọn đúng đắn bất kể sáu điểm đó.

Đầu vào âm thanh và video.Danh sách của Meta quảng cáo hỗ trợ văn bản, hình ảnh, video, âm thanh và PDF làm đầu vào. Claude Fable 5 chỉ chấp nhận văn bản, hình ảnh và tệp tin — không có âm thanh, không có video. Đối với bất kỳ pipeline nào xử lý bản ghi hoặc cảnh quay, đây không phải là sự đánh đổi mà là một bộ lọc cứng. Một lưu ý trung thực: thẻ thông số kỹ thuật của Artificial Analysis cho Muse Spark 1.2 chỉ ghi nhận văn bản và hình ảnh được đánh giá, vì vậy bề mặt hỗ trợ rộng hơn chỉ được quảng cáo chứ không được xác minh độc lập.

Tốc độ. 165.0 token/giây so với 71.7. Muse Spark 1.2 phát trực tuyến đầu ra nhanh hơn gấp đôi, và xếp hạng #16/185 về tốc độ so với mức trung vị của nhóm là 71 — Fable 5 nằm ở mức trung vị.

Chi phí theo số lượng. Mọi thứ trong phần trước.

Thêm một điều thứ tư cho bất kỳ ai có yêu cầu thực sự khổng lồ: cả hai mô hình đều quảng cáo khoảng một triệu token ngữ cảnh — 1,048,576 cho Muse Spark 1.2, 1,000,000 cho Fable 5 — nhưng Muse Spark 1.2 tính phí cố định cho toàn bộ dung lượng đó, trong khi chính sách giá ghi cache của Fable 5 có nghĩa là việc giữ một tiền tố ổn định lớn sẽ tốn tiền thật ngay từ đầu trước khi nó bắt đầu giúp bạn tiết kiệm bất kỳ khoản nào.

Không cái nào trong số này là mô hình nhanh.

Đây là phần mà hầu hết các cuộc so sánh trực tiếp bỏ qua, và nó thay đổi kiến trúc chứ không phải hóa đơn.

Ở mức nỗ lực suy luận tối đa, Artificial Analysis đo thời gian đến token đầu tiên là 26.12 giây cho Muse Spark 1.2 và 141.26 giây cho Claude Fable 5, với thời gian phản hồi từ đầu đến cuối cho Fable 5 là 148.24 giây. Cả hai đều không nên xuất hiện trước người dùng ở các cài đặt đó.

Các số liệu sản xuất thực tế dễ chịu hơn nhiều và đáng để biết. Trên OrcaRouter, Claude Fable 5 cho thấy thời gian p50 đến token đầu tiên là 7,04 giây và p95 là 10,00 giây trong một tuần trượt — đó là lưu lượng thực tế ở bất kỳ mức nỗ lực nào người gọi yêu cầu, không phải điểm chuẩn ở mức tối đa. Muse Spark 1.1, để tham khảo, có p50 là 1,84 giây. Muse Spark 1.2 chưa có dữ liệu telemetry sản xuất.

Muse Spark 1.2 vs Claude Fable 5

Điểm cấu trúc: cả hai mô hình đều có suy luận bắt buộc. Núm điều chỉnh mức độ nỗ lực của Fable 5 chạy từ low đến max và mặc định ở high; của Muse Spark 1.2 chạy từ minimal đến xhigh và mặc định ở medium. Cả hai đều không cho phép tắt suy luận. Nếu bạn cần phản hồi trong chưa đầy một giây, toàn bộ bài so sánh này nằm sai kệ — đó là việc của mẫu mô hình lớp Luna hoặc Flash-Lite.

Bộ xếp chồng hai mô hình, giá đã được công bố.

Cái sai là coi đây như một lựa chọn kiểu “kẻ thắng cuộc nhận hết”, bởi vì lưu lượng công việc không đồng nhất. Hầu hết các tác nhân vận hành đều có một phần đuôi dài gồm các bước thường nhật — đọc một tệp tin, tóm tắt một bản diff, định dạng một bản vá, quyết định gọi công cụ nào tiếp theo — và một phần đầu ngắn gồm những việc thực sự khó, nơi một câu trả lời sai làm tốn cả giờ đồng hồ.

Giả sử cùng một nghìn bước agent mỗi ngày. Tất cả đều chạy trên Claude Fable 5: khoảng $750. Tất cả đều chạy trên Muse Spark 1.2: khoảng $88. Chia 900 bước thông thường cho mô hình giá rẻ và 100 bước khó cho mô hình đắt tiền: khoảng $79 cộng $75, tức là $154 mỗi ngày. Đó là một phần năm chi phí khi dùng toàn bộ Fable trong khi vẫn duy trì năng lực tiên phong ở một phần mười số cuộc gọi thực sự cần đến nó — và mức chênh lệch khoảng $220,000 mỗi năm trên một vòng lặp agent.

Lý do khiến việc xây dựng split đáng công sức hơn là chỉ mô tả nó là vì trước đây nó đòi hỏi hai mối quan hệ với nhà cung cấp, hai SDK và hai bộ thông tin xác thực. Hiện tại thì không còn như vậy. Claude Fable 5 có trong danh mục OrcaRouter với giá $10.00 và $50.00 — giá niêm yết của nhà cung cấp, chuyển qua với mức phụ phí 0% — và Muse Spark 1.1 cũng có ở đó với giá $1.25 và $4.25 theo cùng cơ chế, đằng sau cùng một endpoint tương thích OpenAI. DSL định tuyến cho phép bạn diễn đạt "mô hình rẻ trước, tăng cấp khi độ tin cậy thấp hoặc khi lần chạy thử nghiệm thất bại" như một lệnh gọi duy nhất thay vì mã điều phối mà bạn phải tự duy trì, và model fusion cho phép bạn gửi các bước thực sự mơ hồ đến một hội đồng mô hình cùng lúc và so sánh. Bản thân Muse Spark 1.2 vẫn chưa có trong danh mục — Meta cung cấp trực tiếp mô hình này, là nhà cung cấp duy nhất của nó — nên hiện tại, thứ gần nhất bạn có thể xây dựng cho stack này là sử dụng 1.1 ở nhánh chi phí thấp.

Chi tiết về nhà cung cấp duy nhất đó xứng đáng có một dòng riêng trong đánh giá rủi ro. Claude Fable 5 có nhiều tuyến phục vụ và khả năng chuyển đổi dự phòng tự động giữa chúng. Muse Spark 1.2 có chính xác một điểm cuối, do Meta vận hành. Nếu nó gặp sự cố, sẽ không có phương án dự phòng nào là cùng một mô hình.

Mô hình chi phí, không phải phán quyết

Kết quả hữu ích của sự so sánh này không phải là "mô hình nào thắng." Mà là một ngưỡng bạn có thể tính toán cho khối lượng công việc của chính mình.

Hãy ước tính tỷ lệ các cuộc gọi của bạn mà một câu trả lời thuộc loại Muse Spark 1.2 thất bại trong khi một câu trả lời thuộc loại Fable 5 thành công. Nhân với chi phí của một lần thất bại — phút của kỹ sư, một lần merge hỏng, một vòng lặp thử lại, một khách hàng. So sánh con số đó với 66 xu mỗi bước, đó là chi phí để nâng cấp một cuộc gọi từ Muse Spark 1.2 lên Claude Fable 5 trong ví dụ 60K-in / 3K-out ở trên. Nếu tổn thất dự kiến từ một câu trả lời sai vượt quá 66 xu, hãy định tuyến bước đó đến Fable 5. Nếu không, đừng.

Đối với hầu hết các nhóm, phép tính đó đặt Fable 5 vào việc rà soát mã, tạo bản vá cuối cùng, lập kế hoạch kiến trúc và bất cứ thứ gì chạm đến dữ liệu sản xuất, đồng thời đặt Muse Spark 1.2 vào mọi thứ còn lại — đọc tệp, tóm tắt, phân loại kiểm thử, lựa chọn công cụ, phân đoạn khối lượng lớn ở giữa một vòng lặp tác nhân nơi chi phí là thực còn rủi ro mỗi lần gọi thì không.

Một điều cần tiếp tục theo dõi: bảng xếp hạng Design Arena và các chỉ số theo từng chiều cho Muse Spark 1.2, cả hai hiện vẫn chưa tồn tại. Bằng chứng mạnh nhất của Fable 5 nằm chính xác ở các đấu trường đối đầu trực tiếp, nơi mô hình mới của Meta chưa có bất kỳ thành tích nào. Khi thành tích đó xuất hiện, ngưỡng này sẽ dịch chuyển — có thể rất nhiều.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

Liên hệ với chúng tôi

Tham gia cộng đồng

DiscordEmailXGitHubYouTube