
Mistral Large 4 對 MiniMax M3:五個月的進展要付出什麼代價
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 151 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 116 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 249 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
MiniMax M3 是同級中最便宜的模型,而且自 2026 年 5 月 31 日起便一直如此。每百萬輸入 token 為 0.30 美元、每百萬輸出為 1.20 美元、每百萬快取為 0.06 美元,在輸入方面比 Mistral Large 4 便宜約一半,在輸出方面則便宜約兩倍——而且與較新的模型不同,你今天就能購買,無需附帶預覽標籤。Mistral Large 4 是一個 1.05 兆參數的開放權重模型,自 2026 年 10 月 6 日起公開預覽,價格為 0.68 美元與 2.09 美元,並承諾在本月底前釋出權重。兩款開放權重旗艦模型,相隔五個月,而這五個月恰好只在一處顯露無遺:M3 的獨立 Intelligence Index 分數為 29.2,而 Mistral Large 4 的分數至今尚不存在。
這正是這項比較真實的樣貌,而且比價格表所暗示的更有意思。M3 是圍繞一項特定的架構賭注打造——MiniMax Sparse Attention,能在超過一百萬個詞元的脈絡中持續運作,並將影片視為第一級輸入——而且在 Mistral Large 4 不參與競爭的兩個類別中,帳面上勝出:原始輸出長度與原生影片。在其他所有方面,較新的模型才是買家更想要的選擇,而且價格仍然夠低,使這項差異很少成為購買的決定因素。
兩種架構,兩種賭注
MiniMax M3 是 MiniMax 的旗艦級開放權重基礎模型,也是首個在同一次發布中,就將前沿程式編寫與代理能力、百萬詞元上下文視窗,以及原生多模態能力結合在一起的模型。它接受文字、圖像與視訊輸入,並輸出文字,且建構於 MiniMax Sparse Attention 之上——這是一種旨在維持最高 1,048,576 個詞元上下文,並保證至少 512K 的架構。其預訓練流程經過重建,從第一步便以多模態資料擴展至超過 100 兆詞元,而非事後才附加。它的最大輸出為 512,000 個詞元。
Mistral Large 4 做出了不同的押注。它是一個細粒度的專家混合模型,在總計 1.05 兆個參數中有 490 億個活躍參數,並配備一個 16 億參數的視覺編碼器,在 Mistral 自家的歐洲資料中心內、於 3,800 顆 NVIDIA Grace Blackwell GPU 上從頭訓練,使用的資料涵蓋超過 160 種語言。它接受文字和圖像——沒有影片——上下文約達 100 萬個 token,而 Mistral 將其定位為圍繞主權部署:歐洲基礎設施、開放權重,以及能依你自己的政策運行它的能力,並以網路安全作為旗艦用例。
• 上下文視窗 — MiniMax M3 1,048,576 個 token,對比 Mistral Large 4 約 1,000,000 個
• 最大輸出 — MiniMax M3 為 512,000 個 token,相較之下 Mistral Large 4 尚未有相關記載
{{1}}• 輸入模態 — MiniMax M3 文字、圖像與影片,對比 Mistral Large 4 的文字與圖像{{/1}}
• 輸入價格 — MiniMax M3 每 1M $0.30,對比 Mistral Large 4 每 1M $0.68
• 輸出價格 — MiniMax M3 每 1M $1.20,對比 Mistral Large 4 每 1M $2.09
• 快取輸入 — MiniMax M3 每 1M $0.06,對比 Mistral Large 4 每 1M $0.07
• 參數 — Mistral Large 4 總計 1.05T / 啟用 49B,對比 MiniMax M3 未公開
• 發布:MiniMax M3 2026年5月31日 vs Mistral Large 4 2026年10月6日,預覽版
• 權重——兩者皆為開放授權,Mistral Large 4 的權重承諾於 2026 年 10 月底前發布

計分板上的比分並不接近,而且也不公平。
在 Artificial Analysis Intelligence Index v4.3.2 上,MiniMax M3 拿下 29.2 分,在 147 個模型中排名第 62。這是中段班的成績,且並非對該模型的批評——該 Index 在 M3 發布後才修訂,並納入了 MiniMax 訓練當時還不存在的評估項目。其程式設計子分數更能說明實情:在 AA Coding index 上為 58.6,在 138 個中排名第 46,並在 Terminal-Bench 2.1 上達到 65.2%。它在 GPQA Diamond 上維持 92.9%,在長上下文召回上為 83%,在 SciCode 上為 47.1%。
Mistral Large 4 在同一排行榜上沒有 Index 分數;該頁面以標題「Mistral Large 4 Preview」上線,但數字從缺。Mistral 實際公布的是,ML4 在綜合 Coding Agent Index 上以 49.8% 領先 DeepSeek V4 Pro 0813 與 Qwen3.8 Max;而在 AutomationBench——涵蓋 Gmail、Sheets、Slack 與 Salesforce 的 657 個業務工作流程——上,它得分 59.9%,領先 Kimi K3、MiMo-V2.6-Pro 與 DeepSeek V4 Pro。MiniMax 在兩項比較中都未被提及,這本身即是個訊號,透露出 Mistral 認為哪個模型才是真正的競爭對手。
所以公允的解讀是這樣:M3 是一款能力不錯、價格便宜、文件齊全的模型,一般評分位居中段,程式編寫表現也還算體面,已推出五個月。ML4 則是預覽模型,宣稱的上限更高,但沒有公布一般評分,還有一組代理式數據,是 Artificial Analysis 私下評估的,等那套測試框架上線後,會在 Coding Agent Index 上公布。如果你今天就需要一個數字,M3 能給你。如果你能等幾週,ML4 也會給你一個,而 Mistral 賭的是它會更高。
在 M3 完全沒有來自 ML4 的競爭的情況下
那張清單上的兩行不是取捨,而是一種缺席。
影片輸入是首要項目。M3 原生支援影片,並可搭配文字與圖像。Mistral Large 4 只接受文字和圖像,其他一概不行——Mistral 自家的深入剖析,談的是以吉像素衛星影像與工程圖為基礎進行錨定,而這仍然屬於圖像範疇的工作。如果你的管線需要攝取螢幕錄影、監控影片或影片紀錄,那麼無論價格如何,ML4 都當不了那個模型。這是 Mistral 靠重新定價也補不上的缺口。
輸出長度是第二項。M3 單次回應最多可輸出 512,000 個 token。Mistral 尚未公布 ML4 的輸出上限。一次生成冗長且結構化的成品——完整報告、大型遷移指令碼、完整規格書——正是 512K 上限比一分 Intelligence Index 分數更有價值的工作負載;而且在 Mistral 以文件載明 ML4 的限制之前,這兩者之中只有 M3 能讓你據以規劃這類工作負載。
M3 由廠商回報的代理式數據也印證了同樣的概況。MiniMax 在自主網路研究的 BrowseComp 上給出 83.5,在電腦使用的 OSWorld-verified 上給出 70,在工具使用的 MCP Atlas 上給出 74.2,在 GDPval 評分標準上給出 76.7,並在 SWE Bench Pro 上給出 59。這些數據來自 MiniMax 自家的評估,尚未經過獨立重現,而且它們與其 29.2 的 Index 分數顯得格格不入——這正是廠商與獨立評估的區別之所以重要的原因。一個模型可以在廠商挑選的基準測試中領先,卻在中立的十項評估平均中落在中段,而這兩件事可以同時成立。
2x 值得嗎?
這裡的價格差距以絕對值來說確實很小,這改變了盤算方式——相較於與閉源旗艦模型相比時的懸殊差距。以一個月一億個 token、輸入/輸出比為 4:1 來算:8,000 萬個輸入 token 和 2,000 萬個輸出。M3 計費 $24 加 $24,總計 $48。Mistral Large 4 計費 $54.40 加 $41.80,總計 $96.20。溢價約為每月 $48——在規模化下是實實在在的開銷,但這種差距只要避免一次失敗就足以抵付。
快取進一步縮小了差距,而且僅略微對 M3 有利:每百萬個快取符元 $0.06 對上 $0.07,在這個價位上只是四捨五入的誤差。兩者都便宜到足以讓決策取決於能力與契合度,而不是帳單金額;這與這項比較乍看之下的解讀正好相反。
付費升級所換來的是跨度。ML4 是在五個月後以更新的資料訓練而成,採用混合專家架構,擁有 1 兆個參數,其中 490 億個為活躍參數,而 Mistral 正以每日 330 億個 token 的公開數字對其進行強化學習,且該訓練尚未飽和。M3 已經完成;ML4 則依照公開的節奏持續改進。當廠商說你今天購買的模型,是你未來付費所能取得的最弱版本,而相較於現有模型的溢價每百萬個 token 不到一美元時,較新的模型通常就是更好的預設選擇。例外是上述的兩個工作負載,在那些情況下,較舊的模型是唯一合適的。
繞過間隙的路由

這是一種搭配組合,同時運行兩者並不是對沖,而是真正的答案,因為這兩個模型各有所長,且強項互不重疊。影片輸入、產出長篇成品,或電腦操作循環:M3。文件與圖像分析、代理式工作流程,或任何需要依你自己的政策在歐洲基礎設施上運行的任務:ML4。沒有任何路由規則能讓其中一個變得冗餘。
兩者都位於 OrcaRouter 上同一個相容 OpenAI 的端點之後,且加價 0%,而供應商定價原封不動地直接傳遞,這讓五個月的價格差距保持誠實——如果 MiniMax 調降 M3 的費率,或 Mistral 結束預覽價,你的路由所依據評估的數字當天就會改變。路由 DSL 正是把這些彼此不相交的優勢變成單一呼叫介面:一條檢查請求模態的規則會把帶有影片的承載內容送到 M3,其餘一切送到 ML4,並確信預覽模型的可用性短暫異常會由自動容錯移轉吸收,而不是散播到你的使用者身上。當單一輸出比單一價格更重要時,模型融合可以同時執行兩者,並讓評審小組挑選,這是一種合理的方式,既能買到 Mistral 宣稱的上限,又能把 M3 有據可查的行為保留為下限。

裁決
MiniMax M3 是兩種工作負載的正確答案,也是第三種站得住腳的答案。影片輸入、數十萬 token 的單次生成,以及電腦操作代理,都是它的地盤;它的價格是同級任何旗艦中最低的,而它公布的中段成績意味著你清楚知道自己得到什麼。對於一個在自己的利基領域尚未被取代的模型來說,推出五個月並不算老。
Mistral Large 4 是其他所有情況的更好預設選擇。每月一億個 token 的成本高出約 48 美元,其參數量和歐洲訓練血統指向更高的上限,其網路安全聲明具體到足以核查,而且承諾的開放權重加上地端部署滿足了 M3 僅提供 API 的企業方案所無法滿足的需求。這個賭注的代價是,你承諾使用的模型,其 Independent Intelligence Index 分數尚未公佈,且 Mistral 表示其行為將在幾週內發生重大變化。
解決這一切的兩個日期:2026 年 10 月底,屆時 ML4 的權重不是正式落地,就是開放權重的承諾開始顯得鬆動;以及 Coding Agent Index 的發布,屆時 Mistral 私下評估的 49.8% 將與 M3 在同一修訂版本上公開的 58.6 程式編寫分數正面交鋒。在那之前,M3 是你驗證得了的模型,ML4 是你押注的模型——而就一億個 token 而言,每月多付 48 美元,那算不上是一場大賭注。
