已生成的主視覺卡片,標題為 Claude Sonnet 5.5 對上 MiniMax M3,副標題說明這款價格便宜 15 倍的模型在哪些方面並駕齊驅,並附有三張數據卡片:長脈絡召回率 82.7% 對 83.0%、Terminal-Bench 4.0 為 63.6% 對 2.0%,以及每項任務成本 $7.60 對 $0.51,頁腳寫著所有數據均依據 Artificial Analysis v4.3.2;MiniMax M3 規格依據 MiniMax。
Guides & Insights

Claude Sonnet 5.5 對比 MiniMax M3:便宜 15 倍的模型實際上在哪裡打成平手

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

在獨立排行榜上有一列,其中 MiniMax M3和Claude Sonnet 5.5是同一個模型,而這不是任何人會猜到的。在長上下文召回上,MiniMax M3 得分 83.0%,Claude Sonnet 5.5 得分 82.7%。MiniMax M3 每百萬輸入 token 要價 $0.30,每百萬輸出要價 $1.20。Claude Sonnet 5.5 則要 $2.00 和 $10.00。在整個 Intelligence Index 中,M3 的實測成本為每項任務 $0.51,而 Claude Sonnet 5.5 為 $7.60——便宜十五倍,而且在唯一一項衡量模型是否仍能在極長文件中找到東西的評估中,它完全不落後。

接著你打開代理式評估,情況反轉得如此徹底,以至於它根本不再構成一場比較。在 Terminal-Bench 4.0 上——這項基準要求模型操作 shell 並真正完成一項軟體任務——MiniMax M3 得分 2.0%,而 Claude Sonnet 5.5 得分 63.6%。在最接近實際生產工作的這項基準上出現三十倍的差距,這不是價格問題,任何以每 token 計算的節省都無法彌補。這場對決所提出的有用問題不是「哪個更好」,而是這兩種失敗模式中,你的工作負載能吸收哪一種:MiniMax M3 是開放權重、百萬 token、原生影片的模型,在檢索上能與前沿模型匹敵,在執行上卻徹底崩潰;而 Claude Sonnet 5.5 則是 2026 年 9 月 28 日推出的閉源模型,其表現恰好相反。

每一項是什麼,簡單明瞭地說明。

MiniMax M3 是這家中國實驗室的旗艦開放權重基礎模型,於 2026 年 6 月 1 日發表,並可依 MiniMax 自家的社群授權條款下載。它是一個混合專家模型,總參數約 4,280 億,每個 token 約啟用 230 億參數;而且它在嚴格意義上是原生多模態:文字、圖像與影片輸入,文字輸出,多模態流程是從預訓練第一步就重新打造,而非事後外掛。上下文視窗為 1,048,576 個 token——在我們自家的目錄條目中,保證可用的下限為 512,000——最大輸出為 512,000 個 token,這是我們的數字而非廠商的,因為 MiniMax 並未公布。其架構為 MiniMax 稀疏注意力(MiniMax Sparse Attention),也就是 arXiv 2606.13392 的主題,廠商對它的說法是:在百萬 token 視窗下,預填充速度比前一代快 9 倍以上,解碼速度快 15 倍以上。這些是廠商數字,我們尚未見到獨立重現的結果。

Artificial Analysis model page for MiniMax-M3, an open-weights model released June 2026, showing an Intelligence Index of 29, an output speed of 115.3 tokens per second, $0.30 per million input tokens and $1.20 per million output tokens, $0.51 per Intelligence Index task, a 1M-token context window, and text, image and video input.

Claude Sonnet 5.5 是 Anthropic 第二款 5.5 世代模型,撰文此時才問世一天,而且是封閉的。Anthropic 形容它是產品陣容中速度與智慧的最佳組合,規格為 1,000,000 個詞元的上下文、128,000 個詞元的同步輸出(Message Batches API 上可達 300,000),支援文字、圖像與檔案輸入,具備可選擇努力程度的自適應思考,知識截止日為 2026 年 6 月,且自推出起即提供零資料保留。它的價格與 Claude Sonnet 5 相比並未變動:輸入 $2.00、輸出 $10.00、快取讀取 $0.20、快取寫入 $2.50。Anthropic 表示它比 Claude Sonnet 5 快 30%,每項任務成本最多低 30%——這些都是廠商數據、未經重現,且應理解為關於詞元數量的說法,而非費率,因為費率完全相同。

基準的形狀說明了一切

兩個模型都是在同一個指標、修訂版 v4.3.2 上進行衡量,而正是各次評估的結果,讓這個配對顯得有趣,而非一面倒。

• 長上下文召回 — MiniMax M3 83.0% 對上 Claude Sonnet 5.5 82.7%,在真正的平局上僅是四捨五入的誤差

• SciCode — MiniMax M3 47.1% 對比 Claude Sonnet 5.5 61.0%,一個真實但尚可承受的差距

• Humanity's Last Exam — MiniMax M3 39.0% 對比 Claude Sonnet 5.5 55.0%

• Terminal-Bench 4.0 — MiniMax M3 2.0% 對上 Claude Sonnet 5.5 63.6%,此時比較已不再有用

• 智慧指數 — MiniMax M3 29 對 Claude Sonnet 5.5 56

• 每次 Index 任務成本 — MiniMax M3 $0.51 對比 Claude Sonnet 5.5 $7.60

• 在 Index 中生成的輸出 token — MiniMax M3 120M 對比 Claude Sonnet 5.5 410M

• 輸出速度 — MiniMax M3 115.3 token/秒 對比 Claude Sonnet 5.5 138.7 token/秒

依序讀過那些列,一個連貫的模型便會浮現。MiniMax M3 在靜態推理與檢索上表現稱職,在持續執行上則很弱。它的 Terminal-Bench 結果不是小幅不足;2.0% 的分數意味著該模型基本上無法完成任務,而同樣的模式也顯現在其自動化基準測試分數 0.21 對比 0.71,以及全知分數 1.35 對比 32.3 上。MiniMax M3 真正站穩腳步之處,正是其架構宣稱具有優勢的地方:一段真正很長的輸入,被讀取並回答。那正是 MSA 在做 MiniMax 當初推銷它要做的事。

Generated comparison scoreboard titled Claude Sonnet 5.5 vs MiniMax M3, the scoreboard, with six matched rows: input price $2.00 vs $0.30, output price $10.00 vs $1.20, Intelligence Index 56 vs 29, cost per task $7.60 vs $0.51, long-context recall 82.7% vs 83.0%, and Terminal-Bench 4.0 63.6% vs 2.0%, with a footer reading All figures per Artificial Analysis v4.3.2; MiniMax M3 is open-weight under MiniMax's community licence.

成本這條線還帶出第二個較不明顯的重點。MiniMax M3 不僅每 token 更便宜——輸入端為 1/6.7,輸出端為 1/8.3——它得出答案所耗費的 token 也更少,在同一套評測中約為 1.2 億對 4.1 億。這兩種效應相乘,造就了每項任務十五倍的差距。這個差距有一部分是真正的效率,有一部分則單純是因為 MiniMax M3 在它做不好的任務上更早放棄;一個便宜卻回傳錯誤答案的任務並不是節省,而這是本文中最便宜的一課。

價目表無法顯示的維度

MiniMax M3 擁有一項 Claude Sonnet 5.5 沒有、也無法取得的特性:你可以把權重帶走。這對某一類買家至關重要,而對那類買家而言,它的重要性勝過上述一切。如果某個請求不能離開司法管轄區、不能跨越網路邊界,或必須在完全無法觸及任何 API 的地方執行,那麼沒有可下載權重的模型無論價格多低都不是選項,而一個 4280 億參數的開放權重模型則是。同樣的特性在另一方面則是負擔:自行託管 428B 參數、其中 23B 為活躍參數,是一項資本決策,而不是一組 API 金鑰;而 MiniMax 自家的稀疏注意力主張之所以存在,是因為在百萬 token 情境下的替代方案是難以負擔的基礎設施。

對其他人來說,誠實的說法是:這是自建與外購之間的取捨,而且附帶價格標籤。Claude Sonnet 5.5 是更適合任何代理式任務的模型。MiniMax M3 則更適合閱讀極龐大的內容並回答相關問題,而且在處理影片方面明顯是更好的模型,而 Claude Sonnet 5.5 完全不接受影片——它的輸入介面是文字、圖像和檔案。

• 權重 — MiniMax M3 依 MiniMax 社群授權條款開放,對比 Claude Sonnet 5.5 封閉

• 輸入模態 — MiniMax M3 支援文字、圖像與影片,對比 Claude Sonnet 5.5 支援文字、圖像與檔案

• 最大輸出 — 依我們的產品目錄,MiniMax M3 為 512,000 個 token,而 Claude Sonnet 5.5 同步模式為 128,000,Batches 模式則為 300,000

• 快取定價 — MiniMax M3 每百萬次讀取 $0.06,相較於 Claude Sonnet 5.5 讀取 $0.20、寫入 $2.50

• 投入程度控制 — MiniMax M3 的思考為啟用、自適應或停用,對比 Claude Sonnet 5.5 的自適應思考,後者現在需要between_tools形式

• 資料保留 — 若為自架部署,MiniMax M3 由你自己的部署環境管控;相較之下,Claude Sonnet 5.5 在推出時即可向 Anthropic 取得零資料保留

同時執行兩者,而無需執行兩個

把一個開放權重的中國模型和一個封閉的 Anthropic 模型放進同一條管線,營運成本通常不是 token;而是第二份合約、第二把金鑰、第二套速率限制,以及第二個可能出錯的地方。OrcaRouter 把這些收攏成一個相容 OpenAI 的端點,涵蓋 200 多個模型,供應商定價原樣傳遞——雙方都不加價——上游供應商之間自動容錯切換,還有一套路由 DSL,能把多個模型組合成單一次呼叫。MiniMax M3 在這裡可以透過 minimax/minimax-m3 進行路由,價格為 MiniMax 的 $0.30 與 $1.20,快取讀取 $0.06;而它是目錄中流量最繁忙的模型之一,這本身就是有用的訊號:路由層能告訴你一個模型實際承載多少真實負載,而不只是它得了幾分。

Claude Sonnet 5.5 尚未收錄於我們的目錄中,本文也不會假裝它已經上架。如今要取用它,只能透過 Anthropic 自家的 API。在此,Claude Sonnet 5 能以同樣的 $2.00 與 $10.00 價格進行路由,而且自 6 月 30 日起便是如此;在其後繼者才剛問世一天之際,它自然是現成的過渡目標與容錯移轉夥伴。

那個組合——長上下文切換,以及同一組憑證背後的代理式路徑——正是路由器派得上用場之處。MiniMax M3 每週透過這個目錄承載 6,320 萬個 token 的流量,相較之下 Claude Sonnet 5 只有 790 萬,所以這個便宜模型在這裡並非理論上的替代品;它早已扛起這樣的流量。用同一把金鑰路由兩者,意味著這個分配是一項你可以把流量移過去的組態決策,而不是一紙在你測試較便宜那一側之前就得簽下的第二份合約。

OrcaRouter model page for minimax/minimax-m3, dated 2026-05-31, showing the Vision, Tools, JSON and Reasoning badges, a 1M-token context window, 512K maximum output, text, image and video input, $0.30 input and $1.20 output per million tokens, a p50 time to first token of 10.00 s, and 63.2M tokens of recent traffic.

領帶該怎麼處理

如果你的工作負載是文件規模的問答——極長的輸入、簡短的事實性答案、可忍受的延遲——那麼長上下文打成平手是真的,而 MiniMax M3 的十五倍成本優勢也同樣是真的。那是個直接了當的替換,值得在本週測試。

如果你的工作負載屬於代理型,Terminal-Bench 這條曲線會在價格進入討論之前就決定一切。Claude Sonnet 5.5 每項 Index 任務要價 $7.60,對上 MiniMax M3 的 $0.51,等於為了一個在最接近你生產流量的評估中高出六十分的模型支付 15 倍溢價;而那個便宜十五倍、卻無法完成任務的選項,才是昂貴的那一個。要拿你自己的資料來跑的衡量指標,是每項完成任務的 token 數,而不是每項請求的 token 數,因為那是本文中唯一一項 MiniMax M3 的價格優勢無法理所當然成立的數字。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新