Muse Spark 1.2 so với DeepSeek V4 Flash: Bốn điểm chỉ số cho hóa đơn gấp chín lần
Guides & Insights

Muse Spark 1.2 so với DeepSeek V4 Flash: Bốn điểm chỉ số cho hóa đơn gấp chín lần

Tác giả

Jim Song

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

$72.02 và $637.85. Đó là số tiền Artificial Analysis đã chi để chạy DeepSeek V4 FlashMuse Spark 1.2 qua cùng chín bài kiểm tra, và các mô hình chỉ cách nhau bốn điểm — 50 so với 54 trên Chỉ số Trí tuệ. Mô hình của Meta tốt hơn. Nó cũng đắt hơn 8.9 lần để thực hiện cùng một công việc, có trọng số đóng, được phục vụ bởi đúng một nhà cung cấp, và trẻ hơn DeepSeek V4 Flash năm ngày. Liệu bốn điểm có đáng với cái giá đó hay không hoàn toàn phụ thuộc vào những gì bạn đang xây dựng, và sự so sánh này chủ yếu nhằm làm cho câu hỏi đó có thể trả lời được.

Cả hai mô hình ra mắt cách nhau chưa đầy một tuần — {{1}}DeepSeek V4 Flash (build 0731) vào ngày 31 tháng 7 năm 2026, Muse Spark 1.2 vào ngày 5 tháng 8{{/1}} — và cả hai đều được tiếp thị cho công việc tác tử dài hạn. {{2}}Tất cả chỉ số, con số độ trễ và chi phí đánh giá dưới đây đều đến từ Artificial Analysis, tổ chức tự chạy các bài benchmark và công bố chi phí.{{/2}} {{3}}Nếu một con số đến từ Meta hoặc từ tài liệu của chính nhà cung cấp thay vì từ một lần chạy độc lập, câu văn sẽ nói rõ điều đó.{{/3}}

Bốn con số quyết định điều này

Chỉ số Thông minh — Muse Spark 1.2 54 (#13 trong số 185), DeepSeek V4 Flash 50 (#3 trong số 101 trong phân khúc của nó, so với mức trung vị của phân khúc là 25).

Giá pha trộn trên mỗi triệu token — $0.78 so với $0.06. Gấp mười ba lần.

Chi phí của cùng một bộ chín điểm chuẩn — $637.85 so với $72.02.

Nơi bạn có thể chạy nó — một nhà cung cấp với trọng số đóng, so với sáu nhà cung cấp API cộng với trọng số được cấp phép MIT mà bạn có thể tự lưu trữ.

Cùng một bộ, hai hóa đơn rất khác nhau

Cột chi phí đánh giá là phép so sánh chi phí trung thực nhất hiện có cho hai mô hình, vì đó là cùng một công việc, được định giá theo biểu giá riêng của từng mô hình, và mỗi mô hình dùng bao nhiêu token tùy theo quyết định của chính nó. Muse Spark 1.2 cần $637.85 để hoàn thành Intelligence Index. DeepSeek V4 Flash cần $72.02 — rẻ hơn mọi mô hình nổi tiếng khác mà Artificial Analysis từng đo lường, một phát hiện đã có được đợt truyền thông riêng vào đầu tháng Tám.

Điều làm cho khoảng cách đó trở nên thú vị là nó xảy ra mặc dù mô hình DeepSeek V4 Flash dài dòng hơn, chứ không phải vì điều đó. Khi chạy bộ kiểm thử, DeepSeek V4 Flash đã tạo ra 210 triệu token đầu ra so với 95 triệu token của Muse Spark 1.2 — nhiều hơn gấp đôi. Mô hình của Meta tiết kiệm token hơn đáng kể khi thực hiện cùng một tác vụ, và điều đó chẳng quan trọng chút nào, vì DeepSeek V4 Flash tính phí $0.28 cho mỗi triệu token đầu ra so với $4.25 của Meta. Lợi thế về giá 15× nuốt chửng bất lợi về độ dài dòng 2.2× mà không hề để ý.

Đây là điều cần đưa vào mô hình chi phí của riêng bạn. Hiệu quả token là một đặc tính thực sự và các mô hình suy luận khác nhau rất lớn ở khía cạnh này, nhưng với mức chênh lệch thị trường hiện tại, nó chỉ là một yếu tố thứ yếu. Bảng giá là yếu tố quyết định, và nó chỉ thay đổi khi hai mô hình có giá chênh lệch nhau trong khoảng gấp 3×.

Bốn điểm nằm ở đâu — và điều chưa ai công bố

Đây là phần khó chịu của cuộc so sánh này: Chỉ số Thông minh là tổng hợp của chín bài đánh giá về tác nhân, lập trình, năng lực chung và lý luận khoa học, và Artificial Analysis vẫn chưa công bố bảng phân tích theo từng điểm chuẩn cho Muse Spark 1.2. Vì vậy, "54 so với 50" hiện chỉ là một tiêu đề mà không có sự phân tách. Bốn điểm có thể là khoảng cách về lập trình, khoảng cách về ngữ cảnh dài, khoảng cách về khả năng chống ảo giác, hoặc bốn khoảng cách nhỏ triệt tiêu lẫn nhau trong khối lượng công việc của bạn.

Số liệu riêng của mỗi hãng lấp một phần khoảng trống, và không bên nào có thể đối chiếu với bên kia. Meta báo cáo Terminal-Bench 2.1 đạt 82,9% cho Muse Spark 1.2 (tăng từ 76,2% của bản 1.1) và DeepSWE v1.1 đạt 59,3% (tăng từ 53,0%) — chạy trên bộ khung thử nghiệm của Meta, pass@1 qua năm lần thử, với mỗi mô hình cạnh tranh được ghép với sản phẩm agent riêng của nó. Bản phát hành V4 Flash định vị mô hình này như một bản nâng cấp hậu huấn luyện được tinh chỉnh cho tác vụ agent và terminal trên mô hình mixture of experts tổng 284B / 13B hoạt động. Không có benchmark nào mà cả hai phòng thí nghiệm đều công bố con số có thể so sánh được, và không bên thứ ba nào tái tạo được một trong hai bộ số liệu.

Điều được xác lập một cách độc lập thì hẹp và đáng nói thẳng: trên một chỉ số tổng hợp, do một nhà đánh giá vận hành, Muse Spark 1.2 dẫn trước 4 điểm, với chi phí gấp 8,9 lần. Mọi thứ chi tiết hơn thế vẫn chỉ là tư liệu của nhà cung cấp.

Ba cách thanh toán cho Muse Spark 1.2, một rưỡi cho DeepSeek

So sánh giá ở đây khó nắm bắt một cách bất thường, vì Meta cung cấp hai bảng giá và nhà cung cấp tự đưa ra trọng số.

Gói tiêu chuẩn Meta — 1,25 USD cho mỗi triệu token đầu vào, 0,15 USD cho mỗi triệu token đầu vào được lưu cache, 4,25 USD cho mỗi triệu token đầu ra, với trần tốc độ khoảng 3.000 yêu cầu/phút.

Gói đóng góp Meta — $0.10 cho đầu vào, $0.002 cho đầu vào đã lưu bộ nhớ đệm, $0.20 cho đầu ra, để đổi lấy quyền huấn luyện các mô hình Meta trong tương lai trên lưu lượng truy cập của bạn, giới hạn ở mức 60 yêu cầu mỗi phút.

Danh sách DeepSeek V4 Flash — $0.14 đầu vào, $0.28 đầu ra, $0.003 khi trúng bộ nhớ đệm (giảm 98%, mức giá bộ nhớ đệm thấp nhất trong phân khúc này), từ sáu nhà cung cấp API cạnh tranh.

DeepSeek V4 Flash tự lưu trữ — trọng số mở theo giấy phép MIT, nên cái giá phải trả là phần cứng của bạn và giới hạn là năng lực của bạn.

Đọc dòng thứ hai và dòng thứ ba cùng nhau, thứ hạng sẽ đảo ngược: ở cấp contributor, Muse Spark 1.2 rẻ hơn trên mỗi token so với DeepSeek V4 Flash, ở mức $0.10/$0.20 so với $0.14/$0.28, trong khi đạt điểm cao hơn bốn điểm. Đây là mức giá mạnh nhất trong toàn bộ so sánh này và gần như không ai có thể dùng được, vì 60 yêu cầu mỗi phút chỉ chiếm 2% ngân sách tiêu chuẩn và về cơ bản loại trừ mọi dạng fan-out trong sản xuất. Mức giá này dành cho việc đánh giá và công việc của nhóm nhỏ, và đơn vị tiền tệ của bạn chính là các prompt. Liệu sự đánh đổi đó có sẵn cho bạn hay không là quyết định về quản trị dữ liệu thuộc về bộ phận pháp lý, chứ không phải một hạng mục để bạn hoán đổi trong tệp cấu hình.

Về phía open-weights thì ngược lại. Trọng số MIT có nghĩa là mức giá sàn hoàn toàn không do nhà cung cấp đặt ra — nếu nhu cầu sử dụng của bạn đủ lớn để biện minh cho chi phí GPU, thì không ai có thể tăng giá, ngừng hỗ trợ mô hình của bạn, hoặc thay đổi điều khoản. Tính linh hoạt đó không có gì tương đương ở phía Meta tại bất kỳ hạng nào.

Một nhà cung cấp so với sáu

Muse Spark 1.2 được phục vụ bởi Model API của Meta và không nơi nào khác. Không có nhà cung cấp lưu trữ bên thứ ba, không có lựa chọn lượng tử hóa, không có đường dự phòng, và — tính đến thời điểm viết bài — không có danh sách OpenRouter, không có kho lưu trữ Hugging Face và không có mục nào trong danh mục OrcaRouter. Một mô hình đóng với một nhà cung cấp duy nhất vốn dĩ là một điểm lỗi duy nhất, và với một mô hình mới chỉ năm ngày tuổi, không có lịch sử uptime nào để trấn an bạn.

DeepSeek V4 Flash là trường hợp ngược lại. Sáu nhà cung cấp API hiện đang phục vụ nó, trọng số được cấp phép MIT, và nó có mặt trong danh mục OrcaRouter với giá $0.15 đầu vào và $0.29 đầu ra — giá niêm yết của nhà cung cấp, chuyển thẳng với mức chênh lệch 0% — cùng khả năng chuyển đổi dự phòng tự động giữa các nhà cung cấp, nhờ đó một máy chủ bị suy giảm hiệu năng sẽ không kéo toàn bộ khối lượng công việc sụp đổ theo. Đó chính là lập luận thực tiễn cho mô hình rẻ hơn, hoàn toàn không liên quan đến điểm số của nó: bạn có thể di chuyển nó, nhân bản nó, hoặc rời bỏ hoàn toàn, và không lựa chọn nào trong số đó đòi hỏi một tích hợp mới.

Đối với Muse Spark 1.2 hiện nay, việc đánh giá đồng nghĩa với một hợp đồng thứ hai, một hóa đơn thứ hai và một đường dẫn SDK thứ hai. Mô hình của Meta đáng để thử nghiệm dựa trên giá trị thực tế của nó, nhưng cần hiểu rõ rằng chi phí vận hành khi chạy nó không chỉ là giá token.

Độ trễ, được đo trên lưu lượng thực tế

{{1}}Trong khung benchmark, Artificial Analysis ghi nhận thời gian đến token đầu tiên là 1,33 giây cho DeepSeek V4 Flash và 26,12 giây cho Muse Spark 1.2 ở cài đặt suy luận xhigh, với tốc độ đầu ra lần lượt là 103,3 và 165,0 token mỗi giây.{{/1}} {{2}}Mô hình của Meta tạo sinh nhanh hơn sau khi đã khởi động và mất rất lâu để bắt đầu, đúng như những gì xảy ra khi bắt buộc suy luận ở mức nỗ lực tối đa.{{/2}}

Số liệu sản xuất kể một phiên bản dịu nhẹ hơn của cùng một câu chuyện. Trong suốt bảy ngày định tuyến trực tiếp trên OrcaRouter, DeepSeek V4 Flash cho thấy thời gian p50 đến token đầu tiên là 439 mili giây và p95 là 1,96 giây, với tốc độ 111 token mỗi giây và tỷ lệ lỗi 1,6%. Không có số liệu sản xuất tương đương nào cho Muse Spark 1.2 vì nó chưa được định tuyến ở đâu cả; Muse Spark 1.1, proxy gần nhất hiện có, đạt p50 là 1,84 giây và p95 là 6,00 giây. Phản hồi trung vị dưới một giây là hạng mục mà DeepSeek V4 Flash đang thuộc về và chưa có phiên bản Muse Spark nào lọt vào.

Cả hai mô hình đều tuyên bố khoảng một triệu token ngữ cảnh — 1.048.576 cho cả hai, với DeepSeek V4 Flash giới hạn đầu ra ở 384.000 token và endpoint Muse Spark không công bố bất kỳ giới hạn đầu ra nào. Về ngữ cảnh, cuộc so tài này hòa trên lý thuyết và chưa được kiểm chứng trong thực tế đối với cả hai.

Ba câu hỏi đáng hỏi trước khi bạn chuyển đổi

Tự lưu trữ DeepSeek V4 Flash có thực sự rẻ hơn $0.15 mỗi triệu không?

Thông thường là không, và đó chính là vấn đề. Một mô hình hỗn hợp chuyên gia với 284B tham số và 13B tham số kích hoạt cần công suất đa GPU lớn để phục vụ với độ trễ hợp lý, và ở mức $0,15 cho mỗi triệu token đầu vào, giá lưu trữ khó có thể bị đánh bại trừ khi khối lượng sử dụng rất cao và rất ổn định. Giá trị của giấy phép MIT đối với hầu hết các nhóm không phải là họ sẽ tự lưu trữ — mà là họ hoàn toàn có thể, điều này giới hạn mức giá mà bất kỳ nhà cung cấp nào có thể tính và loại bỏ rủi ro ngừng hỗ trợ. Hãy coi nó như một khoản bảo hiểm, và mua token lưu trữ.

Gói đóng góp có làm cho Muse Spark 1.2 trở thành mẫu rẻ hơn không?

Trên biểu giá, thì là có; trên thực tế, chỉ dành cho khối lượng công việc dưới 60 yêu cầu mỗi phút mà dữ liệu của bạn được phép đóng góp. Nếu cả hai điều kiện đều thỏa mãn — một đợt nghiên cứu tăng vọt, một công cụ nội bộ, một bộ khung đánh giá trên dữ liệu tổng hợp — thì một mô hình vượt trước bốn điểm chỉ số với mức giá mỗi token thấp hơn thực sự là lựa chọn mua tốt hơn và bạn nên dùng nó. Nếu một trong hai điều kiện không thỏa mãn, gói tiêu chuẩn mới là mức giá thực, và gói tiêu chuẩn gấp 13 lần mức giá kết hợp của mô hình V4 Flash.

Bốn điểm chỉ số nghe có vẻ nhỏ. Khi nào điều đó lại quan trọng?

Khi sai số cộng dồn. Trong một lần gọi phân loại hoặc tóm tắt duy nhất, chênh lệch bốn điểm trong chỉ số tổng hợp thường không thể nhận thấy, và trả gấp 9 lần cho nó là không thể biện minh. Trong một vòng lặp agent năm mươi bước, một khác biệt về tỷ lệ thành công mỗi bước có vẻ nhỏ lại nhân lên thành một khác biệt lớn về tần suất toàn bộ lần chạy phải khởi động lại — và một lần khởi động lại tốn toàn bộ quỹ đạo, không phải một bước. Đó là trường hợp mà mức giá của Meta có thể bàn cãi. Đó cũng là trường hợp bạn nên đo lường trên tác vụ của riêng mình thay vì tin vào chỉ số tổng hợp, vì chưa ai công bố chỉ số phụ agentic để phân định điều đó cho 1.2.

Phán quyết, và điều kiện kèm theo

Đối với hầu hết mọi khối lượng công việc mà chi phí là một ràng buộc trực tiếp, DeepSeek V4 Flash là lựa chọn mặc định đúng đắn: thấp hơn bốn điểm trên một chỉ số tổng hợp, tổng hợp rẻ hơn mười ba lần, độ trễ trung vị dưới một giây trong môi trường sản xuất, sáu nhà cung cấp, trọng số MIT, và không nhà cung cấp nào có thể tự ý thay đổi điều khoản của bạn. Hiện tại, đây là mô hình nổi tiếng rẻ nhất để chạy toàn bộ bộ benchmark, và nó không đạt được điều đó nhờ kém chất lượng.

Muse Spark 1.2 xứng đáng với giá tiền của nó trong một loại hình công việc cụ thể: lập trình tác tử dài hạn, nơi một chuỗi thao tác thất bại phải trả giá đắt, nơi sự cân nhắc thêm được phân bổ trên nhiều phút làm việc thay vì khiến người dùng đang chờ phải chịu đựng, và nơi bạn có thể chấp nhận một nhà cung cấp duy nhất mà không có sự phân tích độc lập về thành phần của bốn điểm số đó. Meta đã phát hành ba mô hình trong bốn tháng và tăng mười một điểm chỉ số trong khoảng thời gian đó, vì vậy luận điểm này có thể nhanh chóng được củng cố — nhưng hiện tại nó dựa trên các điểm chuẩn lập trình do nhà cung cấp vận hành và một điểm tổng hợp duy nhất.

Nếu bạn đang lựa chọn trong tuần này, hãy chạy cả hai trên năm mươi bước của vòng lặp agent của riêng bạn và so sánh số quỹ đạo hoàn thành trên mỗi đô la thay vì số token trên mỗi đô la. Phép đo duy nhất đó trả lời sự so sánh này tốt hơn mọi điểm chuẩn đã công bố trong đó.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

Liên hệ với chúng tôi

Tham gia cộng đồng

DiscordEmailXGitHubYouTube