
MiniMax M3 vs Muse Spark 1.2: Khoảng cách giá gấp 4 lần đối đầu với màn càn quét benchmark
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MiniMax M3 có giá 0,30 đô la cho mỗi triệu token đầu vào trên danh mục của chúng tôi. Muse Spark 1.2 có giá 1,25 đô la. Đó là khoảng cách 4,2 lần ở đầu vào và 3,5 lần ở đầu ra, và đây là sự thật hữu ích nhất về cặp mô hình này, bởi vì trên cùng các trang danh mục, Muse Spark 1.2 dẫn trước MiniMax M3 ở mọi hàng điểm chuẩn mà cả hai mô hình đều tham gia. Một bên là lựa chọn trọng số mở giá rẻ với 512K ngữ cảnh khả dụng được nhà cung cấp đảm bảo và mức trần đầu ra 512K. Bên còn lại là một checkpoint suy luận của Meta, hiện đã chậm hơn một thế hệ so với chính dòng sản phẩm của nó và vẫn đạt điểm cao hơn nó ở gần như mọi nơi. Phần còn lại của trang này bàn về việc sự thật nào trong hai sự thật đó thực sự quyết định một tác vụ — và câu trả lời không giống nhau cho mọi tác vụ.
Thực chất mỗi mô hình trong số này là gì
Cả hai đều đã ra mắt trong năm nay và cả hai đều không mới. Điều đó quan trọng, bởi vì một trang so sánh được viết như thể một trong hai đang ra mắt sẽ tự trở nên lỗi thời trong vòng một tháng.

MiniMax M3 là bản phát hành của chính MiniMax, được công bố trên blog của nhà cung cấp vào ngày 2026-06-01 với tiêu đề “MiniMax M3: Lập trình đỉnh cao, Ngữ cảnh 1M, Đa phương thức gốc — Tất cả trong một mô hình”. Bài đăng mở đầu thẳng thừng: “MiniMax M3 chính thức ra mắt hôm nay.” Ba tuyên bố của MiniMax về nó là: nó đạt hiệu năng ngang tầm tiên tiến nhất trong lập trình và công việc agentic; nó sử dụng MSA (MiniMax Sparse Attention), một kiến trúc attention mới do công ty đề xuất; và nó có khả năng đa phương thức gốc — nó nhận đầu vào hình ảnh và video, và theo cách nói của MiniMax, “có thể vận hành một máy tính để bàn.” MiniMax nói thêm rằng ba khả năng này là điều kiện tối thiểu đối với các mô hình tiên tiến nguồn đóng, và rằng M3 là “mô hình trọng số mở đầu tiên và duy nhất kết hợp cả ba lại với nhau.” Danh mục của chúng tôi liệt kê mô hình này là có sẵn từ 2026-05-31, sớm hơn ngày trên blog một ngày.
Muse Spark 1.2 là của Meta. Danh mục của chúng tôi ghi ngày phát hành là 2026-08-05. Đây không phải là một bậc mới — mà là một checkpoint cập nhật so với Muse Spark 1.1 với hiệu năng cao hơn một chút, được phục vụ trên cùng bậc Standard với mức giá y hệt, khiến nó trở thành một bản nâng cấp thay thế trực tiếp chứ không phải một sản phẩm riêng biệt. Đặc điểm nổi bật của nó là bề mặt đầu vào: văn bản, hình ảnh, video, âm thanh và PDF. Đầu ra là văn bản.
Có một mẩu bối cảnh nên nằm ở đây thay vì bị chôn ở phía sau. Meta đã đưa dòng Muse Spark lên mốc 1.3 vào ngày 2026-09-02, khiến 1.2 trở thành thế hệ trước của chính dòng này. Điều đó đã xảy ra cách đây ba tuần, nên đây không phải tin mới và trang này không coi đó là tin mới — nhưng bất kỳ ai hôm nay đang cân nhắc giữa hai mô hình này nên biết rằng họ đang so sánh một mô hình MiniMax hiện hành với một mô hình Meta đã bị thay thế.
Giá trên mỗi triệu token và chi phí thực tế của một khối lượng công việc

Các mức giá được công bố, được lấy từ trang của từng mô hình trên danh mục của chính chúng tôi, nơi chuyển nguyên giá niêm yết của nhà cung cấp mà không cộng thêm phụ phí:
• Đầu vào — MiniMax M3 $0.30 mỗi 1 triệu token so với Muse Spark 1.2 $1.25 mỗi 1 triệu token
• Đầu ra — MiniMax M3 $1.20 mỗi 1M so với Muse Spark 1.2 $4.25 mỗi 1M
• Đọc cache — MiniMax M3 $0.060 mỗi 1M so với Muse Spark 1.2 $0.150 mỗi 1M
• Tỷ lệ — Muse Spark 1.2 là 4,2x ở đầu vào, 3,5x ở đầu ra, 2,5x ở đọc bộ nhớ đệm
Những tỷ lệ trừu tượng đó trở nên cụ thể trong công cụ tính chi phí trên mỗi trang. Đặt cả hai ở mức 10 triệu token một tháng với 70% là phần đầu vào — một cấu hình hợp lý cho công việc tóm tắt hoặc trích xuất, và cũng là mặc định mà công cụ ước tính đi kèm — thì MiniMax M3 cho ra $5.70 một tháng. Muse Spark 1.2 cho ra $11.30 một tháng. Bật bộ nhớ đệm prompt thì cùng khối lượng công việc đó rơi vào khoảng $4.86 so với khoảng $9.63. Công cụ tính toán gắn nhãn cả hai là ước tính dựa trên giá niêm yết, và đó là lưu ý đúng đắn: số token thực tế phụ thuộc vào tokenizer của nhà cung cấp.
Với một workload rẻ, khoảng cách chỉ là tiền cà phê. Điều quan trọng là hình dạng của đường cong, không phải con số tuyệt đối: một workload 100 triệu token thiên về đầu ra mỗi tháng sẽ vượt từ ba chữ số lên bốn chữ số chỉ riêng ở phía Muse Spark. Nếu chi phí là ràng buộc khiến bạn cân nhắc sự kết hợp này, thì đó chính là con số bạn cần mô phỏng trên lưu lượng của chính mình.
Vì chúng tôi chuyển thẳng giá niêm yết của nhà cung cấp mà không cộng thêm markup, nên khi nhà cung cấp giảm giá, phía chúng tôi sẽ thấy ngay trong ngày giá đó được công bố, và cả hai mô hình này đều được định tuyến đến đây — một key dùng chung cho cả hai, vì vậy việc định giá chúng với nhau không cần hợp đồng thứ hai hay thay đổi mã.
Cửa sổ ngữ cảnh, và những gì thực sự vừa trong đó
Đây là phần mà hai sản phẩm trông giống nhau nhất trên bảng thông số kỹ thuật và khác nhau nhất khi sử dụng.
• Cửa sổ ngữ cảnh — MiniMax M3 1,048,576 token so với Muse Spark 1.2 1,048,576 token
• Đầu ra tối đa — MiniMax M3 512.000 token so với Muse Spark 1.2 131.072 token
• Phạm vi đầu vào — MiniMax M3 văn bản, hình ảnh và video so với Muse Spark 1.2 văn bản, hình ảnh, video, âm thanh và PDF
• Bề mặt đầu ra — cả hai chỉ phát ra văn bản
• Tham số có cấu trúc — MiniMax M3 cung cấp tools và tool_choice; Muse Spark 1.2 cung cấp reasoning_effort và structured_outputs
Cả hai cửa sổ đều có cùng một triệu token, nên câu hỏi "ai có nhiều ngữ cảnh hơn" không có người thắng. Dòng đầu ra tối đa là nơi chúng tách nhau: một phản hồi MiniMax M3 có thể chạy tới 512.000 token, gấp khoảng bốn lần mức trần 131.072 của Muse Spark 1.2. Nếu công việc của bạn là tạo nội dung dạng dài — viết lại toàn bộ tệp, một báo cáo dài, một đầu ra ở quy mô bản ghi — thì khác biệt đó mang tính cấu trúc, không phải gia tăng. Nếu công việc của bạn là đưa ra câu trả lời ngắn trên một đầu vào dài, thì điều đó không liên quan.
Hàng về bề mặt đầu vào lại nghiêng theo hướng ngược lại. Muse Spark 1.2 chấp nhận âm thanh và PDF trực tiếp; bề mặt đầu vào được tài liệu hóa của MiniMax M3 chỉ dừng ở hình ảnh và video. Một pipeline tiếp nhận bản ghi cuộc gọi hoặc tài liệu quét sẽ có lượng tiền xử lý khác nhau cho mỗi bên trong hai bên này.
Về phía MiniMax, tuyên bố về ngữ cảnh đi kèm một ghi chú kiến trúc cần được ghi rõ ràng là của chính nhà cung cấp. MiniMax quy hành vi ngữ cảnh dài của M3 cho MSA (MiniMax Sparse Attention), thứ mà danh mục của chúng tôi mô tả là hỗ trợ tối đa 1M token ngữ cảnh "với mức tối thiểu được đảm bảo là 512K." Cách diễn đạt "tối thiểu được đảm bảo" là của MiniMax; chúng tôi không có phép đo độc lập nào về con số này để dẫn ra, nên hãy coi mức sàn 512K là tuyên bố của nhà cung cấp chứ không phải một con số đã được kiểm nghiệm.
Độ trễ và thông lượng trên gateway của chính chúng ta
Đây là những số liệu mà chúng tôi có thể nói tới một cách trực tiếp nhất, vì chúng là số liệu của chính chúng tôi. Chúng bao gồm bảy ngày tính đến ngày 2026-09-23 và mô tả lưu lượng truy cập trên gateway của chúng tôi, không phải đánh giá chuẩn của nhà cung cấp.
• p50 thời gian đến token đầu tiên — MiniMax M3 4,28 giây so với Muse Spark 1.2 4,82 giây
• thời gian đến token đầu tiên (p95) — MiniMax M3 10.00 giây so với Muse Spark 1.2 10.00 giây
• Tốc độ xuất — MiniMax M3 289 tok/s so với Muse Spark 1.2 507 tok/s
• Tỷ lệ lỗi — MiniMax M3 0,12% so với Muse Spark 1.2 0,15%
• Lưu lượng truy cập, 7 ngày qua — MiniMax M3 153,8 triệu token so với Muse Spark 1.2 79,6 triệu token
Đọc điều này một cách trung thực thì bức tranh bị chia đôi. Về thời gian đến token đầu tiên, hai bên khá sát nhau — 4,28 so với 4,82 giây ở mức trung vị, và p95 giống hệt nhau đến chữ số thập phân thứ hai ở 10,00 giây, đó là một hiện tượng làm tròn do cả hai đều nằm gần cùng một mức trần chứ không phải là một sự hòa thực sự. Về tốc độ đầu ra thì chúng hoàn toàn không gần nhau: Muse Spark 1.2 truyền phát ở tốc độ xấp xỉ 1,75 lần tốc độ của MiniMax M3, điều này thay đổi cảm nhận của người dùng khi theo dõi một lượt sinh dài, ngay cả khi tổng chi phí cao hơn. Tỷ lệ lỗi nằm trong sai số làm tròn của nhau và cả hai đều thấp.
Dòng lưu lượng này đáng được đọc như một tín hiệu hơn là một bảng điểm: trong cùng bảy ngày, MiniMax M3 đã xử lý khoảng gấp đôi số token so với Muse Spark 1.2 trên gateway của chúng tôi. Đó là điều thị trường đang chọn, không phải điều các benchmark nói, và với cặp so sánh này, hai bên không đồng nhất.
Định tuyến cả hai phía sau một endpoint cũng là cách rẻ để tìm ra cái nào mà workload của bạn ưa thích hơn, vì failover có nghĩa là sự suy giảm từ phía nhà cung cấp ở một trong hai model sẽ chuyển sang một đường dẫn đang hoạt động thay vì báo lỗi.
Gọi công cụ và công việc tác tử tầm xa
Đây là điểm mà hai bên khác biệt xa nhất về kết quả đo lường, và cũng là nơi những lưu ý đóng vai trò quan trọng nhất.
• Terminal-Bench v2.1 — MiniMax M3 52.4 so với Muse Spark 1.2 80.1
• tau_banking (sử dụng công cụ) — MiniMax M3 12.3 so với Muse Spark 1.2 34.8
• MCP Atlas — MiniMax M3 74.2 (do nhà cung cấp báo cáo) so với Muse Spark 1.2 chưa được đo lường
• BrowseComp — MiniMax M3 83,5 (do nhà cung cấp báo cáo) so với Muse Spark 1.2 chưa được đo lường
• OSWorld-Verified — MiniMax M3 70.0 (do nhà cung cấp báo cáo) so với Muse Spark 1.2 không được đo
Hai hàng đầu tiên đến từ bảng đánh giá trên các trang danh mục của chính chúng tôi và là những hàng agentic duy nhất mà cả hai mô hình đã điền. Chúng không hề sát nhau: Muse Spark 1.2 đạt hơn gấp đôi MiniMax M3 trên tau_banking và dẫn trước Terminal-Bench v2.1 gần 28 điểm. Nếu khối lượng công việc của bạn là một agent tầm xa với bề mặt công cụ, thì đó là khoảng cách đơn lẻ lớn nhất trên trang này.
Ba hàng tiếp theo là số liệu của chính MiniMax, được công bố trong bài đăng ra mắt. Chúng không thể so sánh với hai hàng đầu tiên — khung đánh giá khác nhau, không có kiểm toán độc lập — nhưng chúng là những con số duy nhất được công bố cho MiniMax M3 trên các tác vụ đó, nên nếu bỏ qua sẽ đánh giá thấp mô hình. Hãy đọc chúng như số liệu do nhà cung cấp báo cáo và không hơn thế.
Một điểm khác biệt đáng được dành hẳn một đoạn riêng, vì đây là kiểu điều mà một trang so sánh thường lờ đi cho êm chuyện. Bài đăng ra mắt của MiniMax hiển thị Terminal-Bench 2.1 ở mức 66.0 đối với M3, nằm trong một hình biểu đồ không kèm bảng số liệu nào. Dòng Terminal-Bench v2.1 độc lập trên trang danh mục của chúng tôi cho thấy 52.4 đối với cùng mô hình đó. Tên các tác vụ đủ giống nhau đến mức độc giả sẽ bắt gặp chúng cạnh nhau, và hai con số chênh nhau hơn 13 điểm. Chúng tôi sẽ không tuyên bố một trong hai con số là sai: lời giải thích khả dĩ là do dùng một harness khác hoặc một cấu hình chạy khác, và điều trung thực cần nói là con số của chính nhà cung cấp và con số đã được kiểm toán không khớp với nhau, trong đó con số của nhà cung cấp cao hơn.
Danh sách tham số kể một câu chuyện nhỏ hơn, thực tiễn hơn. MiniMax M3 cung cấp tools và tool_choice, nên việc chọn công cụ có thể được điều hướng từ yêu cầu. Muse Spark 1.2 cung cấp reasoning_effort, nên thay vào đó độ sâu suy luận có thể được điều hướng. Cả hai đều không cung cấp nút điều chỉnh của bên kia. Nếu bài toán kiểm soát của ứng dụng của bạn là “khiến nó gọi đúng hàm”, điều đó chỉ về một hướng; nếu là “khiến nó suy nghĩ lâu hơn với các trường hợp khó”, điều đó chỉ về hướng còn lại.
Lập trình
Lập trình là tuyên bố chủ đạo của MiniMax M3 và cũng là nơi mà khoảng cách được đo lường trở nên khó xử nhất đối với nó.
• AA Coding Index — MiniMax M3 38.7 so với Muse Spark 1.2 72.2
• SciCode — MiniMax M3 43.1 so với Muse Spark 1.2 57.4
• SWE-Bench Pro — MiniMax M3 59.0 (theo báo cáo của nhà cung cấp) so với Muse Spark 1.2 chưa được đo
• KernelBench Hard — MiniMax M3 28.8 (do nhà cung cấp báo cáo) so với Muse Spark 1.2 chưa được đo
Định vị của MiniMax cho M3 là lấy lập trình làm trọng tâm — tiêu đề ra mắt đặt "Frontier Coding" lên trước ngữ cảnh triệu token và tính đa phương thức. Con số SWE-Bench Pro 59.0 do chính họ báo cáo là một con số mạnh trên bộ kiểm thử của nhà cung cấp. Tuy nhiên, trên các hàng Coding Index và SciCode độc lập mà cả hai mô hình đều đã điền, Muse Spark 1.2 dẫn đầu với khoảng cách lớn, và khoảng cách 33 điểm trên Coding Index là khoảng cách lớn thứ hai trên trang này, sau tau_banking.
Không có cách nào trung thực để trình bày MiniMax M3 như là mô hình lập trình tốt hơn dựa trên bằng chứng hiện có. Điều có thể nói là các con số lập trình do chính nhà cung cấp công bố thì cao, còn các con số độc lập thì không, theo cùng một kiểu như sự chênh lệch Terminal-Bench ở trên. Bất kỳ ai mà quyết định phụ thuộc vào lập trình nên đặt trọng số lớn hơn cho các hàng đã được kiểm toán so với các biểu đồ trong bài đăng ra mắt, và nên kiểm thử trên kho mã của chính họ thay vì dựa vào một trong hai.
Nơi họ thực sự gần gũi
Ba hàng không chịu cho ra một người thắng cuộc, và nói thẳng điều đó hữu ích hơn là dựng lên một người.
• GPQA Diamond — MiniMax M3 89,9 so với Muse Spark 1.2 90,4, một khoảng cách 0,5 điểm mà xét theo bất kỳ mục đích thực tiễn nào thì đều là hòa
• thời gian đến token đầu tiên ở mức p95 — cả hai đều là 10,00 giây trong bảy ngày qua trên gateway của chúng tôi
• Cửa sổ ngữ cảnh và phương thức đầu ra — giống hệt nhau ở 1,048,576 token đầu vào và đầu ra chỉ văn bản
Ở khả năng suy luận khoa học trình độ sau đại học, hai mô hình này gần như không thể phân biệt được, và đó là hàng suy luận duy nhất mà mô hình rẻ hơn nhiều của MiniMax M3 vẫn trụ vững trước mô hình đắt hơn. Điều này đáng ghi nhớ khi đọc các chỉ số tổng hợp: khoảng cách giữa các mô hình này không đồng đều trên các năng lực, mà tập trung vào công việc agentic và lập trình, và gần như bằng không ở dạng trắc nghiệm thiên về kiến thức.

Chọn MiniMax M3 nếu, chọn Muse Spark 1.2 nếu
Hai dữ kiện từ đoạn mở đầu được giải quyết theo những cách khác nhau tùy vào thứ bạn đang xây dựng, nên đây là sự phân tách không hề rào đón.
• Chọn MiniMax M3 nếu chi phí trên mỗi token là ràng buộc quyết định, nếu bạn cần đầu ra dạng dài vượt quá 131.072 token, nếu bạn cần trọng số mở, nếu bạn muốn đầu vào video mà không cần một pipeline riêng, hoặc nếu bạn muốn công việc tri thức thiên về lập luận với mức giá chỉ khoảng một phần tư giá đầu vào — GPQA Diamond là một cuộc đua sát nút và đó chính là hạng mục mà mẫu rẻ tiền khẳng định được chỗ đứng của mình.
• Hãy chọn Muse Spark 1.2 nếu khối lượng công việc của bạn là một agent có công cụ hoạt động trong thời gian dài, nếu bạn cần điểm số lập trình được kiểm toán cao nhất, nếu bạn muốn có một nút điều chỉnh reasoning_effort rõ ràng, nếu bạn cần nạp trực tiếp âm thanh hoặc PDF, hoặc nếu bạn cần đầu ra truyền phát nhanh — 507 tok/s so với 289 tok/s là một khác biệt nhìn thấy được, chứ không phải khác biệt chỉ trên benchmark.
• Nếu bạn chưa biết nên chọn cái nào, bằng chứng mang tính quyết định không nằm trên trang này. Hãy đặt cả hai mô hình đối chiếu với một mẫu lưu lượng truy cập của chính bạn và đo lường; công cụ tính giá trên mỗi trang mô hình sẽ cho bạn biết phần chi phí trong vòng một phút, và các số liệu độ trễ bảy ngày ở trên là thứ gần nhất với một bản xem trước về mặt hiệu năng.
Cả hai đều chạy trên một API với mức giá không đội lên so với giá niêm yết của nhà cung cấp, nên việc dùng thử chỉ là đổi model-id chứ không phải một cuộc di trú, và cơ chế chuyển đổi dự phòng tự động nghĩa là một ngày xấu ở một trong hai nhà cung cấp sẽ suy giảm thành một câu trả lời chậm hơn thay vì một sự cố ngừng dịch vụ.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
