Muse Spark 1.2 so với Claude Haiku 4.5: Mức giá hỗn hợp giống hệt nhau, nhưng quan điểm trái ngược về tư duy
Guides & Insights

Muse Spark 1.2 so với Claude Haiku 4.5: Mức giá hỗn hợp giống hệt nhau, nhưng quan điểm trái ngược về tư duy

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Artificial Analysis định giá Muse Spark 1.2 ở mức $0.78 cho mỗi triệu token trung bình và Claude Haiku 4.5 ở mức $0.77. Chênh nhau một xu, đến từ hai phòng thí nghiệm mà không thống nhất được điều gì khác. Mô hình của Meta không thể ngừng suy luận; Claude Haiku 4.5 chỉ suy luận khi bạn yêu cầu. Meta cung cấp cho bạn 1.048.576 token ngữ cảnh; Claude Haiku 4.5 cung cấp 200.000. Meta phát hành mô hình này vào ngày 5 tháng 8 năm 2026 như một mô hình lập trình với một tác tử đầu cuối đính kèm; Claude Haiku 4.5 được phát hành vào tháng 10 năm 2025 như một công nhân nhanh, rẻ mà một mô hình lớn hơn chỉ bảo làm gì. Cùng một mức giá mỗi token, nhưng lại là những cỗ máy hoàn toàn khác nhau.

Sự trùng hợp đó là điểm xuất phát hữu ích để so sánh, vì nó loại bỏ biến số mà người ta thường dựa vào để quyết định và buộc câu hỏi phải xoay quanh hình dạng thay vào đó. Phần sau sử dụng các số liệu độc lập khi có sẵn — Artificial Analysis cho điểm số và độ trễ phòng thí nghiệm, dữ liệu vận hành bảy ngày của chính OrcaRouter cho độ trễ lưu lượng thực tế — và xác định rõ các con số do nhà cung cấp công bố, bao gồm một con số điểm chuẩn nổi bật của nhà cung cấp mà bên thứ ba không có số liệu tương ứng.

Đối chiếu thông số, từng chiều một.

• Giá — Muse Spark 1.2 với $1.25 đầu vào / $4.25 đầu ra mỗi triệu; Claude Haiku 4.5 với $1.00 đầu vào / $5.00 đầu ra. Meta rẻ hơn về đầu vào, còn Claude Haiku 4.5 rẻ hơn về đầu ra.

• Cache — $0,15 mỗi triệu lần truy cập cache trên Muse Spark 1.2, giảm 88%; $0,10 mỗi triệu lần đọc cache trên Claude Haiku 4.5, giảm 90%, với phí ghi cache là $1,25.

• Ngữ cảnh — 1.048.576 token so với 200.000. Chênh lệch gấp 5,2 lần, và là khoảng cách lớn nhất giữa chúng.

• Đầu ra tối đa — Claude Haiku 4.5 công bố giới hạn 64.000 token; endpoint Muse Spark 1.2 không khai báo bất kỳ giới hạn độ dài hoàn thành tối đa nào, điều này đủ bất thường để cần kiểm tra thay vì giả định.

• Suy luận — bắt buộc trên Muse Spark 1.2, với năm mức độ nỗ lực từ tối thiểu đến xhigh và mặc định là trung bình; tùy chọn trên Claude Haiku 4.5, vốn là mô hình không suy luận cho đến khi bạn bật chế độ suy luận mở rộng và cung cấp ngân sách suy luận cho nó.

• Đầu vào — Meta quảng cáo văn bản, hình ảnh, video, âm thanh và PDF; Claude Haiku 4.5 nhận văn bản và hình ảnh. Cả hai đều trả về văn bản.

• Trọng số và nhà cung cấp — cả hai đều bị đóng. Muse Spark 1.2 chỉ được phục vụ bởi Model API của riêng Meta; Claude Haiku 4.5 có sẵn từ nhà cung cấp và thông qua các nhà bán lại và tổng hợp đám mây thông thường.

• Tuổi — Muse Spark 1.2 mới chỉ vài ngày tuổi. Claude Haiku 4.5 đã hoạt động trong sản xuất từ ngày 15 tháng 10 năm 2025, với mốc cắt kiến thức tháng 7 năm 2025 và chín tháng kinh nghiệm thực tế tích lũy đằng sau.

Khoảng cách chỉ số là có thật. Còn con số mà mọi người sẽ trích dẫn thì không.

Artificial Analysis chấm Muse Spark 1.2 đạt 54 trên Chỉ số Trí tuệ của họ, xếp hạng #13/185. Mục nhập hiện tại của họ cho Claude Haiku 4.5 là 24. Đặt hai con số đó cạnh nhau là bạn có một tiêu đề giật tít; nhưng nhìn vào những gì các mục nhập thực sự là, tiêu đề đó sụp đổ.

Con số 54 là Muse Spark 1.2 được đánh giá ở mức xhigh, cấu hình suy luận đắt nhất của nó. Con số 24 là Claude Haiku 4.5 được đánh giá như một mô hình không suy luận — tắt suy nghĩ — và Artificial Analysis gắn cờ đó là ước tính chứ không phải một lần chạy hoàn chỉnh. Trên một phiên bản trước của cùng chỉ số đó, trước khi điều chỉnh lại trọng số v4.1, Artificial Analysis đặt Claude Haiku 4.5 ở mức 55 khi bật suy luận và 42 khi không bật. Những con số cũ đó cũng không thể so sánh với 54, vì các phiên bản chỉ số được thang đo lại và điểm số thời v3 không phải là điểm số v4.1.

Vì vậy, tuyên bố trung thực hẹp hơn so với những gì bảng xếp hạng thể hiện: Muse Spark 1.2 ở mức nỗ lực tối đa đạt 54 điểm trên chỉ số hiện tại; chưa có điểm v4.1 nào được công bố cho Claude Haiku 4.5 khi bật suy luận mở rộng, nên chưa có sự so sánh cùng điều kiện nào giữa hai mô hình này ở mức nỗ lực tối đa. Bất kỳ ai cho bạn xem 54 so với 24 là đang so sánh một mô hình suy luận đầy đủ với một mô hình được yêu cầu không suy luận.

Khi nhà cung cấp công bố một con số, đó là một con số cụ thể: Claude Haiku 4.5 đạt 73.3% trên SWE-bench Verified, tính trung bình qua 50 lần thử với ngân sách suy luận 128K. Đó là con số do nhà cung cấp đưa ra, và ngân sách suy luận trong đó là rất lớn đối với một mô hình được tiếp thị dựa trên tốc độ — nhưng đó cũng chính là bài đánh giá mà ngành công nghiệp trích dẫn cho các mô hình tiên phong, và nó đưa Haiku vào một phân khúc mà mức giá của nó không hề gợi ý. Các tuyên bố đối ứng của Meta cho Muse Spark 1.2 là Terminal-Bench 2.1 đạt 82.9% và DeepSWE v1.1 đạt 59.3%, cũng do nhà cung cấp tự chạy, trên bộ khung đánh giá của riêng Meta, với mỗi đối thủ được ghép với sản phẩm agent của chính nó. Hai nhà cung cấp, hai bộ benchmark, không có sự trùng lặp. Hiện không có một bài đánh giá duy nhất nào mà cả hai mô hình này đều có điểm số công bố từ cùng một bên đánh giá.

Bốn con số độ trễ, hai câu chuyện khác nhau

Độ trễ là nơi mà cách đóng khung "cùng mức giá" không còn chỉ là điều gây tò mò mà bắt đầu trở thành một quyết định, và cũng là nơi mà nguồn đo lường đóng vai trò quan trọng nhất.

Trong bộ công cụ benchmark, Artificial Analysis ghi nhận thời gian đến token đầu tiên là 26,12 giây cho Muse Spark 1.2 ở mức xhigh, và 1,00 giây cho Claude Haiku 4.5. Khoảng cách gấp 26 lần, và nếu mọi chuyện chỉ có vậy thì cuộc so sánh đã kết thúc.

Trong môi trường production thì điều này đảo ngược. Qua bảy ngày lưu lượng thực tế trên OrcaRouter — người gọi sử dụng mức độ nỗ lực tùy ý họ muốn — Claude Haiku 4.5 cho thấy p50 thời gian đến token đầu tiên là 3,84 giây và p95 là 10,00 giây, với 214 token mỗi giây và tỷ lệ lỗi 1,0%. Muse Spark 1.1, phiên bản mô hình của Meta có trong danh mục, cho thấy p50 là 1,84 giây và p95 là 6,00 giây, với 519 token mỗi giây và không ghi nhận lỗi nào. Trên lưu lượng thực tế, mô hình Meta là mô hình nhanh hơn.

Cả hai bộ số đều đúng và chúng đo lường những thứ khác nhau. Con số trong phòng thí nghiệm là từng mô hình ở mức suy luận tối đa với bộ nhớ đệm lạnh — đây là bài kiểm tra công bằng cho trần hiệu năng nhưng lại là bài kiểm tra kém cho một hộp trò chuyện. Con số trong sản xuất bao gồm các lượt truy cập bộ nhớ đệm, prompt ngắn, mức nỗ lực thấp và mọi thứ khác mà ứng dụng thực tế thực hiện — đây là bài kiểm tra công bằng cho giá trị trung vị nhưng hoàn toàn không kiểm tra được trường hợp xấu nhất. Cái bẫy là trích dẫn con số này để suy luận về con số kia. Nếu bạn đang định cỡ thời gian chờ hướng tới người dùng, p95 là con số của bạn. Nếu bạn đang hỏi một bước tác tử sâu tốn bao nhiêu thời gian thực tế, con số benchmark gần với sự thật hơn — và lời cảnh báo trung thực là vẫn chưa có con số sản xuất nào cho Muse Spark 1.2, vì nó quá mới và chưa được định tuyến rộng rãi.

Cả hai phòng thí nghiệm đều bán cho bạn một subagent. Chúng có ý nghĩa khác nhau.

Lời chào hàng của nhà cung cấp dành cho Claude Haiku 4.5 nói rõ về thứ bậc: các mô hình lớp Sonnet lập kế hoạch và điều phối, còn các instance Haiku thực thi song song bên dưới. Rẻ, nhanh, dùng rồi bỏ, nhiều instance cùng lúc. Thiết kế sản phẩm cũng tuân theo — cửa sổ 200K là quá đủ cho một tác vụ con có phạm vi giới hạn và cố tình không đủ cho cả một kho mã nguồn; suy luận bị tắt mặc định vì một worker biết cân nhắc là một worker tốn tiền của bộ điều phối; và chính hoạt động tiếp thị của nhà cung cấp cũng xác định trò chuyện thời gian thực, dịch vụ khách hàng và lập trình cặp đôi là mục tiêu.

Lời giới thiệu của Meta về Muse Spark 1.2 khẳng định cả hai đầu của cùng một hệ thống phân cấp. Nội dung quảng bá của Meta cho biết mô hình có thể là tác nhân chính thu thập ngữ cảnh, lập kế hoạch và phân công, hoặc là một tác nhân phụ chạy song song bên dưới một tác nhân chính. Muse Code, tác nhân đầu cuối ra mắt cùng với nó, điều phối nhiều tác nhân phụ thường trực cho mỗi nhiệm vụ trong các worktree cô lập, trên một runtime nhật ký sự kiện có khả năng phát lại chính xác. Cửa sổ triệu token và khả năng lập luận thường trực là những gì một tác nhân lập kế hoạch cần; chúng chính xác là điều bạn sẽ không chọn cho một tác nhân fan-out, vì mỗi instance song song đều phải trả chi phí cho sự cân nhắc mà bạn không yêu cầu.

Nếu đọc như kiến trúc thay vì tiếp thị, đó mới là khác biệt thực sự: nhà cung cấp xây dựng một "công nhân" và kỳ vọng bạn tự mang đến bộ điều phối; Meta xây dựng một bộ điều phối và tuyên bố nó cũng có thể hoạt động. Nếu bạn đã vận hành một hệ thống phân cấp, thử nghiệm thú vị không phải là chọn giữa hai bên — mà là Muse Spark 1.2 lập kế hoạch và Claude Haiku 4.5 thực thi, một hình thái mà không nhà cung cấp nào sẽ bán cho bạn dưới dạng gói trọn bộ.

Một bước thực sự có giá bao nhiêu trên mỗi

Các mức giá trên mỗi triệu token chẳng quyết định được gì với các mô hình suy luận, vì mô hình tự quyết định sẽ dùng bao nhiêu token. Thay vào đó, hãy định giá theo bước.

Hãy xét một tác vụ mã có phạm vi giới hạn: 60,000 token ngữ cảnh kho lưu trữ đầu vào, 3,000 token bản vá đầu ra. Ở trạng thái nguội, Claude Haiku 4.5 tốn $0.060 cho đầu vào cộng $0.015 cho đầu ra — 7.5 xu. Muse Spark 1.2 tốn $0.075 cộng $0.013 — 8.8 xu. Đủ gần để coi là nhiễu, đúng như mức giá kết hợp đã hứa.

Giờ hãy thêm thứ mà tỷ lệ gộp che giấu. Muse Spark 1.2 không thể tắt suy luận, và ở cài đặt trung bình mặc định, một bước như thế này có khả năng phát ra vài nghìn token suy luận trước bản vá — chúng được tính phí như đầu ra. Thêm 3,000 và bước tương tự sẽ là $0.075 + $0.026 = 10.1 cent, cao hơn khoảng 35% so với Haiku trên cùng đầu vào. Claude Haiku 4.5 với chế độ suy nghĩ tắt không phải trả gì cho việc cân nhắc và vẫn ở mức 7.5 cent; với ngân sách suy nghĩ lớn, nó sẽ vượt Muse Spark 1.2, vì Claude Haiku 4.5 tính $5.00 mỗi triệu đầu ra so với $4.25 của Meta.

Việc lưu vào bộ nhớ đệm lại đảo ngược trọng tâm một lần nữa. Giữ ngữ cảnh kho lưu trữ ổn định để đạt được cache hit, và chi phí đầu vào của Haiku giảm xuống $0.006 còn của Muse Spark 1.2 xuống $0.009 — phía đầu vào hoàn toàn không còn quan trọng, và toàn bộ sự so sánh trở thành cuộc chiến về token đầu ra, tức là cuộc chiến về việc mỗi mô hình suy nghĩ bao nhiêu. Với khối lượng công việc lặp lại ngữ cảnh, độ ổn định của cache-key có giá trị hơn việc lựa chọn mô hình, và điều đó đúng với cả hai mô hình này.

Cửa sổ 1M là nơi duy nhất mà phép toán không khớp. Bất cứ thứ gì thực sự cần hơn 200.000 token trong một lần gọi duy nhất đều không thể chạy trên Claude Haiku 4.5 ở bất kỳ mức giá nào. Bạn hoặc phải chia nhỏ và điều phối — điều mà nhà cung cấp mong muốn — hoặc sử dụng một mô hình có đủ không gian.

Thử cả hai mà không cần hợp đồng thứ hai.

Claude Haiku 4.5 nằm trong danh mục OrcaRouter với giá $1.00 và $5.00 — đây là giá niêm yết của nhà cung cấp, vì OrcaRouter áp dụng mức chênh lệch 0% và chuyển tiếp nguyên vẹn giá từ nhà cung cấp, điều này cũng có nghĩa là khi nhà cung cấp thay đổi giá, phía chúng tôi sẽ cập nhật ngay trong ngày thay vì phải đợi đến chu kỳ hợp đồng tiếp theo. Các số liệu về độ trễ trong sản xuất nêu trên đến từ chính lớp định tuyến đó.

Muse Spark 1.2 không có trong danh mục. {{1}}Model API của Meta hiện là nơi duy nhất có thể gọi nó, nên một cuộc so tài trực diện thực sự ngày hôm nay có nghĩa là một tích hợp qua chúng tôi và một tích hợp trực tiếp với Meta.{{/1}} Muse Spark 1.1 được lưu trữ, với mức giá ${{2}}1.25{{/2}} và ${{3}}4.25{{/3}} giống hệt mức Meta tính cho phiên bản 1.2, điều này khiến nó trở thành một lựa chọn thay thế hợp lý về đặc điểm chi phí và độ trễ của dòng sản phẩm này, nhưng không phải cho những cải tiến về lập trình mà 1.2 được bán dựa trên. Khi 1.2 có thể định tuyến được, việc so sánh chỉ còn là thay đổi chuỗi mô hình một dòng với cùng một khóa — và đối với thử nghiệm orchestrator-plus-worker được mô tả ở trên, {{4}}DSL định tuyến là cách bạn kết nối một bộ lập kế hoạch và một worker phân luồng vào một lệnh gọi duy nhất thay vì tự xây dựng cơ chế bàn giao.{{/4}}

Chọn theo hình thức của công việc, không phải theo điểm số.

Chọn Claude Haiku 4.5 khi công việc có phạm vi giới hạn và người dùng đang chờ đợi. Hỗ trợ các tác nhân, phân loại, trích xuất, trò chuyện, hoàn thành lập trình cặp và tầng công nhân song song trong hệ phân cấp tác nhân. Đây là một lựa chọn đã được biết đến với chín tháng lịch sử triển khai thực tế, chế độ suy luận là tùy chọn nên bạn chỉ trả phí khi muốn cân nhắc, và 200K là đủ cho hầu hết mọi tác vụ con có phạm vi xác định. Kết quả SWE-bench Verified được công bố của nó cho thấy năng lực vượt trội hơn nhiều so với mức giá, miễn là bạn sẵn sàng chi ngân sách suy luận mà kết quả đó đã sử dụng.

Hãy chọn Muse Spark 1.2 khi đơn vị công việc là một kho lưu trữ thay vì một yêu cầu. Tái cấu trúc nhiều tệp tin, gỡ lỗi kéo dài, tạo toàn bộ dự án, các vòng lặp tác nhân dài hạn mà không ai theo dõi vòng xoay tải. Cửa sổ triệu token loại bỏ vấn đề phân đoạn mà Haiku không thể giải quyết ở bất kỳ mức giá nào, và cơ chế suy luận bắt buộc vốn làm hỏng trải nghiệm trò chuyện lại là lựa chọn mặc định đúng đắn khi một kế hoạch sai tốn kém hơn một kế hoạch chậm.

Điều quyết định vấn đề này không phải là số chỉ mục. Thay vào đó, hãy đặt hai câu hỏi: một lần gọi có bao giờ cần xử lý hơn 200.000 token không, và có người đang chờ token đầu tiên không? Có cho câu hỏi đầu tiên nghĩa là chọn Meta. Có cho câu hỏi thứ hai nghĩa là chọn nhà cung cấp. Có cho cả hai nghĩa là bạn cần hai mô hình, và đây là câu trả lời trung thực phổ biến hơn những gì marketing của bất kỳ nhà cung cấp nào thừa nhận.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày