
MiniMax M3 對比 Muse Spark 1.2:4 倍價差對上基準測試橫掃
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MiniMax M3 在我們的型錄中,每百萬輸入 token 的價格為 $0.30。Muse Spark 1.2 則為 $1.25。在輸入上這是 4.2 倍的差距,在輸出上則是 3.5 倍的差距,而這是這組配對中最有用的一項事實,因為在同一個型錄頁面上,Muse Spark 1.2 在兩個模型共有的每一項基準測試列上都領先 MiniMax M3。一款是廉價的開放權重選項,供應商保證具備 512K 可用上下文與 512K 輸出上限。另一款則是 Meta 的推理檢查點,如今已落後自家家族一個世代,卻幾乎在各處仍拿到更高分數。本頁其餘部分要談的是,這兩項事實中哪一項才真正決定工作負載——而答案並非對每種工作負載都相同。
這些模型各自實際上是什麼
兩者都是今年出貨的,且都不是新產品。這一點很重要,因為若比較頁面把任一款當成新上市來寫,不出一個月就會顯得過時。

MiniMax M3 是 MiniMax 自家推出的發布,於 2026-06-01 在該廠商的部落格上以標題「MiniMax M3:前沿程式設計、1M 上下文、原生多模態——集於一身模型」宣布。該文章開門見山地寫道:「MiniMax M3 今日正式發布。」MiniMax 對其提出的三項主張是:它在程式設計與代理式工作上達到前沿級效能、採用 MSA(MiniMax Sparse Attention)這套該公司提出的全新注意力架構,以及它原生支援多模態——可接受圖像與影片輸入,且用 MiniMax 的話來說,「能操作桌上型電腦」。MiniMax 補充說,這三項能力對閉源前沿模型而言是基本門檻,而 M3 是「首個也是唯一將這三者合而為一的開放權重模型」。我們的型錄將該模型列為自 2026-05-31 起可用,比部落格日期早一天。
Muse Spark 1.2 是 Meta 的模型。我們的目錄將其標記為 2026-08-05。它不是新的層級——而是 Muse Spark 1.1 之上的更新檢查點,效能略高,並以相同價格在同一 Standard 層級上提供,這使它成為可直接替換的升級,而非獨立產品。它與眾不同之處在於輸入介面:文字、圖像、影片、音訊與 PDF。輸出則為文字。
有一段背景應該放在這裡,而不是留到後面才提。Meta 已在 2026-09-02 將 Muse Spark 系列推進到 1.3 檢查點,這使得 1.2 成為該系列自身的上一代。這件事發生在三週前,所以不算新聞,本頁也不把它當作新聞——但今天要在這兩者之間做選擇的人應該知道,他們是在把目前的 MiniMax 模型與已被取代的 Meta 模型相比。
每百萬個詞元的價格,以及工作負載實際上要花多少成本

以下公布的價格,取自我們自家目錄中各型號的頁面;該目錄直接沿用供應商的標價,未加任何加成:
• 輸入 — MiniMax M3 每 100 萬個 token 為 $0.30,對比 Muse Spark 1.2 每 100 萬個 token 為 $1.25
• 輸出 — MiniMax M3 每 1M $1.20,對比 Muse Spark 1.2 每 1M $4.25
• 快取讀取 — MiniMax M3 每百萬 $0.060 對比 Muse Spark 1.2 每百萬 $0.150
• 比率 — Muse Spark 1.2 在輸入方面為 4.2 倍,輸出方面為 3.5 倍,快取讀取方面為 2.5 倍
那些抽象的比率在每一頁的成本計算器中都會變成具體數字。將兩者都設為每月一千萬個 token、輸入佔比 70%——這對摘要或擷取工作來說是合理的型態,也是估算器內建的預設值——MiniMax M3 算出來是每月 $5.70。Muse Spark 1.2 算出來是每月 $11.30。開啟提示快取後,同樣的工作負載大約會落在 $4.86,相較之下約為 $9.63。計算器將兩者都標示為根據定價表估算的預估值,這是恰當的但書:實際的 token 數量取決於供應商的分詞器。
對於便宜的工作負載,差距只是一杯咖啡的錢。重點是曲線的形狀,而非絕對值:每月一億個以輸出為主的 token 的工作負載,單就 Muse Spark 這一邊,就會從三位數跨到四位數。如果成本是促使你研究這個搭配的約束條件,那就是你該用自身流量來推估的數字。
因為我們不加價,直接將供應商的標價傳遞出去,所以廠商降價在宣布當天就會反映在我們這邊;而這兩款型號都路由到這裡——一組金鑰即可涵蓋兩者,因此將它們相互比價不需要第二份合約或修改程式碼。
上下文視窗,以及實際上能容納什麼
這正是兩者在規格表上看起來最相似、在實際使用上卻最不相似的段落。
• 上下文視窗 — MiniMax M3 1,048,576 個詞元 對上 Muse Spark 1.2 1,048,576 個詞元
• 最大輸出 — MiniMax M3 512,000 tokens 對比 Muse Spark 1.2 131,072 tokens
• 輸入面向 — MiniMax M3 文字、圖像與影片,對比 Muse Spark 1.2 文字、圖像、影片、音訊與 PDF
• 輸出介面 — 兩者皆僅輸出文字
• 結構化參數 — MiniMax M3 提供 tools 和 tool_choice;Muse Spark 1.2 提供 reasoning_effort 和 structured_outputs
兩個上下文視窗同樣都是百萬個 token,所以「誰擁有更多上下文」這個問題沒有贏家。最大輸出那一列才是它們分出高下的地方:MiniMax M3 的回應最多可達 512,000 個 token,大約是 Muse Spark 1.2 上限 131,072 的四倍。如果你的工作是長篇生成——整份檔案改寫、長篇報告、逐字稿規模的輸出——那個差異是結構性的,而非漸進式的。如果你的工作是在長輸入上給出簡短答案,那它就無關緊要。
輸入介面這一列的比較結果正好相反。Muse Spark 1.2 直接接受音訊與 PDF;MiniMax M3 文件記載的輸入介面則僅止於圖片與影片。對於要匯入通話錄音或掃描文件的流程而言,在這兩者上所需的前置處理工作量並不相同。
在 MiniMax 方面,這項上下文宣稱帶有一項架構註記,值得明確標示為廠商自身的說法。MiniMax 將 M3 的長上下文行為歸因於 MSA(MiniMax Sparse Attention),我們的目錄將其描述為支援最高 1M token 的上下文,「並保證最低 512K」。「保證最低」的表述是 MiniMax 的說法;我們無法指出任何可佐證的獨立量測,因此請將 512K 的下限視為廠商宣稱,而非經過實測的數字。
我們自家閘道器上的延遲與吞吐量
這些是我們能夠最直接談論的數字,因為它們是我們自己的數據。它們涵蓋截至 2026-09-23 的七天,描述的是我們閘道上的流量,而不是某家廠商的基準測試。
• p50 首個 token 時間 — MiniMax M3 4.28 秒 vs Muse Spark 1.2 4.82 秒
• p95 首個 token 時間 — MiniMax M3 為 10.00 秒,對比 Muse Spark 1.2 的 10.00 秒
• 輸出速度 — MiniMax M3 289 tok/s 對比 Muse Spark 1.2 507 tok/s
• 錯誤率 — MiniMax M3 0.12% 對比 Muse Spark 1.2 0.15%
流量,過去 7 天 — MiniMax M3 153.8M 個 token 對比 Muse Spark 1.2 79.6M 個 token
誠實地看這份數據,情況是分裂的。在首個 token 的延遲上,兩者很接近——中位數是 4.28 秒對 4.82 秒,而 p95 連小數第二位都同為 10.00 秒,這其實是兩者都貼近同一個上限所產生的四捨五入假象,而非真正的平手。在輸出速度上,兩者則完全稱不上接近:Muse Spark 1.2 的串流速度大約是 MiniMax M3 的 1.75 倍,這會改變使用者在觀看長篇生成時的體感,即使總成本更高也一樣。錯誤率方面,兩者的差距在四捨五入誤差範圍內,而且都偏低。
流量那一列值得當作訊號來讀,而不是當成計分板:同樣這七天內,MiniMax M3 在我們閘道上處理的 token 量約為 Muse Spark 1.2 的兩倍。這反映的是市場的選擇,而不是跑分說了什麼,而在這一組對比上,兩者並不一致。
將兩者都路由到同一個端點之後,也是找出你的工作負載偏好哪一個的省錢做法,因為容錯移轉意味著任一模型在供應商端發生效能降級時,會退落到仍可運作的路徑,而不是直接報錯。
工具呼叫與長時程代理式工作
這正是兩者在實測結果上差距最大的地方,也是但書最為關鍵之處。
• Terminal-Bench v2.1 — MiniMax M3 52.4 對決 Muse Spark 1.2 80.1
• tau_banking(工具使用)— MiniMax M3 12.3 對比 Muse Spark 1.2 34.8
• MCP Atlas — MiniMax M3 74.2(廠商報告) vs Muse Spark 1.2 未測量
• BrowseComp — MiniMax M3 83.5(廠商自報)對比 Muse Spark 1.2 未測量
• OSWorld-Verified — MiniMax M3 70.0(廠商回報)對比 Muse Spark 1.2 未測量
前兩行來自我們自家型錄頁面上的基準測試面板,也是兩個模型都填寫過的唯一代理式行。它們並不接近:Muse Spark 1.2 在 tau_banking 上是 MiniMax M3 的兩倍以上,並在 Terminal-Bench v2.1 上領先近 28 分。如果你的工作負載是具備工具介面的長時程代理,那就是本頁最大的單一差距。
接下來三列是 MiniMax 自家公布的數字,刊載於產品發表文章中。它們無法與前兩列相比——測試框架不同,且未經獨立稽核——但它們是 MiniMax M3 在那些任務上唯一公布的數據,因此若省略它們,會低估這個模型。請把它們理解為廠商自行回報的結果,僅此而已。
有一處差異值得單獨用一段來說明,因為這正是比較頁面通常會輕輕帶過的那類事情。MiniMax 的發表文章將 M3 在 Terminal-Bench 2.1 的分數呈現為 66.0,且是放在圖表圖片中,沒有附上數字表格。我們目錄頁上獨立的 Terminal-Bench v2.1 列則顯示同一款模型為 52.4。任務名稱足夠相近,讀者會將它們並排看到,而這兩個數字相差超過 13 分。我們不會宣稱其中一個是錯的:可能的原因是使用了不同的測試框架或不同的執行設定;誠實的說法是,廠商自己的數字與經審核的數字彼此不一致,而廠商的數字較高。
參數清單透露的是一個更小、更務實的故事。MiniMax M3 提供 tools 和 tool_choice,因此工具選擇可以從請求端加以操控。Muse Spark 1.2 則提供 reasoning_effort,因此改為可以操控推理深度。兩者都沒有提供對方的調節旋鈕。如果你應用程式的控制問題是「讓它呼叫正確的函式」,那會指向其中一邊;如果是「讓它在困難案例上思考得更久」,那就會指向另一邊。
編程
程式編寫是 MiniMax M3 最受矚目的主打賣點,也是實測差距對它而言最難堪的地方。
• AA Coding Index — MiniMax M3 38.7 對比 Muse Spark 1.2 72.2
• SciCode — MiniMax M3 43.1 對 Muse Spark 1.2 57.4
• SWE-Bench Pro — MiniMax M3 59.0(廠商回報) vs Muse Spark 1.2 未測量
• KernelBench Hard — MiniMax M3 28.8(廠商提供)對比 Muse Spark 1.2 未測量
MiniMax 對 M3 的定位是 coding 優先——發表標題把「Frontier Coding」放在百萬 token 上下文與多模態之前。它在自家廠商測試框架下回報的 SWE-Bench Pro 分數 59.0,是相當強勁的數字。不過,在兩個模型都有填列的獨立 Coding Index 與 SciCode 項目上,Muse Spark 1.2 大幅領先,而 Coding Index 上 33 分的差距是本站頁面上僅次於 tau_banking 的第二大差距。
在現有證據下,沒有任何誠實的方式能把 MiniMax M3 呈現為更優秀的編碼模型。可以說的是,廠商自家的編碼數據很高,而獨立來源的數據則不高,這與上方 Terminal-Bench 的分歧如出一轍。任何以編碼能力作為決策依據的人,都應該更看重經審核的數據列,而非發表貼文中的圖表,並且應該在自己的程式碼庫上測試,而不是依賴這兩者之中的任何一方。
在他們真正親近的地方
三列拒絕產生贏家,而如實說出來,比硬湊出一個更有用。
• GPQA Diamond — MiniMax M3 89.9 對 Muse Spark 1.2 90.4,0.5 分的差距,就任何實際用途而言都算是平手
• p95 首個 token 時間 — 過去七天在我們的閘道上,兩者皆為 10.00 秒
• 上下文視窗與輸出模態 — 在 1,048,576 個輸入 token 與純文字輸出下完全相同
在研究所程度的科學推理上,這兩者實際上難以區分,而那是 MiniMax M3 這款便宜得多的模型唯一能在推理項目上與更昂貴的模型抗衡的一列。閱讀總體指標時值得記住:這些模型之間的差距並非在各項能力上均勻分布,而是集中在代理式與程式設計工作上,並且在知識密集型多選題上大致為零。

選 MiniMax M3 的話,選 Muse Spark 1.2 的話
開頭段落裡的這兩項事實,會因為你正在打造什麼而有不同的結果,所以以下是不含糊其辭的分野。
• 如果每 token 成本是決定性限制,就選 MiniMax M3;如果你需要超過 131,072 tokens 的長篇輸出;如果你需要開放權重;如果你想要無需另建管線的影片輸入;或者如果你想以大約四分之一的輸入價格進行推理密集的知識工作——GPQA Diamond 難分軒輊,而那正是平價模型證明自身價值的一列。
• 如果你的工作負載是搭配工具的長時程代理,請選擇 Muse Spark 1.2;如果你需要最高、經審核的程式編寫分數,如果你想要明確的 reasoning_effort 調節鈕,如果你需要直接匯入音訊或 PDF,或者你需要快速的串流輸出 —— 507 tok/s 對比 289 tok/s 是可見的差異,而不是基準測試上的差異。
• 若你還不知道該選哪一個,決定性的證據並不在這一頁上。讓兩個模型分別套用你自己的流量樣本並加以測量;各模型頁面上的價格計算工具只需一分鐘就能告訴你成本那一面,而上方那組為期七天的延遲數據,則是效能那一面最接近預覽的參考。
兩者都位於同一個 API 上,且不向供應商定價加價,因此試用不過是更換模型 ID,而非遷移,而且自動容錯移轉意味著任一供應商出狀況時,只會退化成較慢的回答,而不是服務中斷。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
