
Claude Sonnet 5.5 對比 MiniMax M3:便宜 15 倍的模型實際上在哪裡打成平手
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 931 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 192 tok/s
- Orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1174 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 107 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- xAISpaceXAI: Grok 4.62026-08-1244智能77程式
在獨立排行榜上有一列,其中 MiniMax M3和Claude Sonnet 5.5是同一個模型,而這不是任何人會猜到的。在長上下文召回上,MiniMax M3 得分 83.0%,Claude Sonnet 5.5 得分 82.7%。MiniMax M3 每百萬輸入 token 要價 $0.30,每百萬輸出要價 $1.20。Claude Sonnet 5.5 則要 $2.00 和 $10.00。在整個 Intelligence Index 中,M3 的實測成本為每項任務 $0.51,而 Claude Sonnet 5.5 為 $7.60——便宜十五倍,而且在唯一一項衡量模型是否仍能在極長文件中找到東西的評估中,它完全不落後。
接著你打開代理式評估,情況反轉得如此徹底,以至於它根本不再構成一場比較。在 Terminal-Bench 4.0 上——這項基準要求模型操作 shell 並真正完成一項軟體任務——MiniMax M3 得分 2.0%,而 Claude Sonnet 5.5 得分 63.6%。在最接近實際生產工作的這項基準上出現三十倍的差距,這不是價格問題,任何以每 token 計算的節省都無法彌補。這場對決所提出的有用問題不是「哪個更好」,而是這兩種失敗模式中,你的工作負載能吸收哪一種:MiniMax M3 是開放權重、百萬 token、原生影片的模型,在檢索上能與前沿模型匹敵,在執行上卻徹底崩潰;而 Claude Sonnet 5.5 則是 2026 年 9 月 28 日推出的閉源模型,其表現恰好相反。
每一項是什麼,簡單明瞭地說明。
MiniMax M3 是這家中國實驗室的旗艦開放權重基礎模型,於 2026 年 6 月 1 日發表,並可依 MiniMax 自家的社群授權條款下載。它是一個混合專家模型,總參數約 4,280 億,每個 token 約啟用 230 億參數;而且它在嚴格意義上是原生多模態:文字、圖像與影片輸入,文字輸出,多模態流程是從預訓練第一步就重新打造,而非事後外掛。上下文視窗為 1,048,576 個 token——在我們自家的目錄條目中,保證可用的下限為 512,000——最大輸出為 512,000 個 token,這是我們的數字而非廠商的,因為 MiniMax 並未公布。其架構為 MiniMax 稀疏注意力(MiniMax Sparse Attention),也就是 arXiv 2606.13392 的主題,廠商對它的說法是:在百萬 token 視窗下,預填充速度比前一代快 9 倍以上,解碼速度快 15 倍以上。這些是廠商數字,我們尚未見到獨立重現的結果。

Claude Sonnet 5.5 是 Anthropic 第二款 5.5 世代模型,撰文此時才問世一天,而且是封閉的。Anthropic 形容它是產品陣容中速度與智慧的最佳組合,規格為 1,000,000 個詞元的上下文、128,000 個詞元的同步輸出(Message Batches API 上可達 300,000),支援文字、圖像與檔案輸入,具備可選擇努力程度的自適應思考,知識截止日為 2026 年 6 月,且自推出起即提供零資料保留。它的價格與 Claude Sonnet 5 相比並未變動:輸入 $2.00、輸出 $10.00、快取讀取 $0.20、快取寫入 $2.50。Anthropic 表示它比 Claude Sonnet 5 快 30%,每項任務成本最多低 30%——這些都是廠商數據、未經重現,且應理解為關於詞元數量的說法,而非費率,因為費率完全相同。
基準的形狀說明了一切
兩個模型都是在同一個指標、修訂版 v4.3.2 上進行衡量,而正是各次評估的結果,讓這個配對顯得有趣,而非一面倒。
• 長上下文召回 — MiniMax M3 83.0% 對上 Claude Sonnet 5.5 82.7%,在真正的平局上僅是四捨五入的誤差
• SciCode — MiniMax M3 47.1% 對比 Claude Sonnet 5.5 61.0%,一個真實但尚可承受的差距
• Humanity's Last Exam — MiniMax M3 39.0% 對比 Claude Sonnet 5.5 55.0%
• Terminal-Bench 4.0 — MiniMax M3 2.0% 對上 Claude Sonnet 5.5 63.6%,此時比較已不再有用
• 智慧指數 — MiniMax M3 29 對 Claude Sonnet 5.5 56
• 每次 Index 任務成本 — MiniMax M3 $0.51 對比 Claude Sonnet 5.5 $7.60
• 在 Index 中生成的輸出 token — MiniMax M3 120M 對比 Claude Sonnet 5.5 410M
• 輸出速度 — MiniMax M3 115.3 token/秒 對比 Claude Sonnet 5.5 138.7 token/秒
依序讀過那些列,一個連貫的模型便會浮現。MiniMax M3 在靜態推理與檢索上表現稱職,在持續執行上則很弱。它的 Terminal-Bench 結果不是小幅不足;2.0% 的分數意味著該模型基本上無法完成任務,而同樣的模式也顯現在其自動化基準測試分數 0.21 對比 0.71,以及全知分數 1.35 對比 32.3 上。MiniMax M3 真正站穩腳步之處,正是其架構宣稱具有優勢的地方:一段真正很長的輸入,被讀取並回答。那正是 MSA 在做 MiniMax 當初推銷它要做的事。

成本這條線還帶出第二個較不明顯的重點。MiniMax M3 不僅每 token 更便宜——輸入端為 1/6.7,輸出端為 1/8.3——它得出答案所耗費的 token 也更少,在同一套評測中約為 1.2 億對 4.1 億。這兩種效應相乘,造就了每項任務十五倍的差距。這個差距有一部分是真正的效率,有一部分則單純是因為 MiniMax M3 在它做不好的任務上更早放棄;一個便宜卻回傳錯誤答案的任務並不是節省,而這是本文中最便宜的一課。
價目表無法顯示的維度
MiniMax M3 擁有一項 Claude Sonnet 5.5 沒有、也無法取得的特性:你可以把權重帶走。這對某一類買家至關重要,而對那類買家而言,它的重要性勝過上述一切。如果某個請求不能離開司法管轄區、不能跨越網路邊界,或必須在完全無法觸及任何 API 的地方執行,那麼沒有可下載權重的模型無論價格多低都不是選項,而一個 4280 億參數的開放權重模型則是。同樣的特性在另一方面則是負擔:自行託管 428B 參數、其中 23B 為活躍參數,是一項資本決策,而不是一組 API 金鑰;而 MiniMax 自家的稀疏注意力主張之所以存在,是因為在百萬 token 情境下的替代方案是難以負擔的基礎設施。
對其他人來說,誠實的說法是:這是自建與外購之間的取捨,而且附帶價格標籤。Claude Sonnet 5.5 是更適合任何代理式任務的模型。MiniMax M3 則更適合閱讀極龐大的內容並回答相關問題,而且在處理影片方面明顯是更好的模型,而 Claude Sonnet 5.5 完全不接受影片——它的輸入介面是文字、圖像和檔案。
• 權重 — MiniMax M3 依 MiniMax 社群授權條款開放,對比 Claude Sonnet 5.5 封閉
• 輸入模態 — MiniMax M3 支援文字、圖像與影片,對比 Claude Sonnet 5.5 支援文字、圖像與檔案
• 最大輸出 — 依我們的產品目錄,MiniMax M3 為 512,000 個 token,而 Claude Sonnet 5.5 同步模式為 128,000,Batches 模式則為 300,000
• 快取定價 — MiniMax M3 每百萬次讀取 $0.06,相較於 Claude Sonnet 5.5 讀取 $0.20、寫入 $2.50
• 投入程度控制 — MiniMax M3 的思考為啟用、自適應或停用,對比 Claude Sonnet 5.5 的自適應思考,後者現在需要between_tools形式
• 資料保留 — 若為自架部署,MiniMax M3 由你自己的部署環境管控;相較之下,Claude Sonnet 5.5 在推出時即可向 Anthropic 取得零資料保留
同時執行兩者,而無需執行兩個
把一個開放權重的中國模型和一個封閉的 Anthropic 模型放進同一條管線,營運成本通常不是 token;而是第二份合約、第二把金鑰、第二套速率限制,以及第二個可能出錯的地方。OrcaRouter 把這些收攏成一個相容 OpenAI 的端點,涵蓋 200 多個模型,供應商定價原樣傳遞——雙方都不加價——上游供應商之間自動容錯切換,還有一套路由 DSL,能把多個模型組合成單一次呼叫。MiniMax M3 在這裡可以透過 minimax/minimax-m3 進行路由,價格為 MiniMax 的 $0.30 與 $1.20,快取讀取 $0.06;而它是目錄中流量最繁忙的模型之一,這本身就是有用的訊號:路由層能告訴你一個模型實際承載多少真實負載,而不只是它得了幾分。
Claude Sonnet 5.5 尚未收錄於我們的目錄中,本文也不會假裝它已經上架。如今要取用它,只能透過 Anthropic 自家的 API。在此,Claude Sonnet 5 能以同樣的 $2.00 與 $10.00 價格進行路由,而且自 6 月 30 日起便是如此;在其後繼者才剛問世一天之際,它自然是現成的過渡目標與容錯移轉夥伴。
那個組合——長上下文切換,以及同一組憑證背後的代理式路徑——正是路由器派得上用場之處。MiniMax M3 每週透過這個目錄承載 6,320 萬個 token 的流量,相較之下 Claude Sonnet 5 只有 790 萬,所以這個便宜模型在這裡並非理論上的替代品;它早已扛起這樣的流量。用同一把金鑰路由兩者,意味著這個分配是一項你可以把流量移過去的組態決策,而不是一紙在你測試較便宜那一側之前就得簽下的第二份合約。

領帶該怎麼處理
如果你的工作負載是文件規模的問答——極長的輸入、簡短的事實性答案、可忍受的延遲——那麼長上下文打成平手是真的,而 MiniMax M3 的十五倍成本優勢也同樣是真的。那是個直接了當的替換,值得在本週測試。
如果你的工作負載屬於代理型,Terminal-Bench 這條曲線會在價格進入討論之前就決定一切。Claude Sonnet 5.5 每項 Index 任務要價 $7.60,對上 MiniMax M3 的 $0.51,等於為了一個在最接近你生產流量的評估中高出六十分的模型支付 15 倍溢價;而那個便宜十五倍、卻無法完成任務的選項,才是昂貴的那一個。要拿你自己的資料來跑的衡量指標,是每項完成任務的 token 數,而不是每項請求的 token 數,因為那是本文中唯一一項 MiniMax M3 的價格優勢無法理所當然成立的數字。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
