
Mistral Large 4 對上 Claude Opus 5:差距比價格差距還小
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 151 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 120 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
任何人發表過的唯一正面對決數字,針對Mistral Large 4對上Claude Opus 5,來自一項盲測人工評估,而且比基準測試表所顯示的還接近。Surge AI 隱藏了模型身分,要求專業標註人員以 1–5 分量表評分程式碼輸出;Claude Opus 5 以 4.22 排名第一,Mistral Large 4 Preview 以 3.74 排名第二,領先 Kimi K3、GLM-5.3 與 GLM-5.2。在獨立彙總指標上,兩者根本差距懸殊——在 10 月 6 日讀取的 Artificial Analysis 的 Intelligence Index 上,分別是 50.8 對 38.4。這組配對值得花一個下午研究的原因在於,分數低了 12 分的模型,執行一項任務的成本大約只有五分之一。
這兩個數字都需要附上其來源出處,因為它們並非同一類型的數字。Surge AI 的評估是 Mistral 委託並發表的第三方人類研究——這比自行執行的基準測試是更強有力的證據形式,而且仍然是一份由 Mistral 掌控其發表的研究。指數分數則是 Artificial Analysis 自行執行的結果,彼此之間可互相比較,因此才是適合用來推理的一對。兩者都無法告訴你該以哪個模型為基礎來開發;但兩者合起來則界定了這個問題的範圍。
兩個產品,而非同一產品的兩個世代
Claude Opus 5 是該廠商的封閉權重旗艦模型,於 2026 年 7 月 24 日發布,提供 1M token 的上下文視窗與最高 128K 的輸出 token,定價為每百萬輸入 token 5 美元、每百萬輸出 token 25 美元,快取讀取則為 0.50 美元。它是該廠商 Opus 系列中能力最強的模型,明確定位於長時程的代理式工作——在多步驟的作業階段中大量使用工具,仍能保持連貫一致。
Mistral Large 4 是一個預覽版,於 2026 年 10 月 6 日發布,Mistral 將其描述為一個 1.05 兆參數的稀疏混合專家模型,具有 490 億個活躍參數與一個 16 億參數的視覺編碼器。其 API id 為 mistral-large-4-0,原生支援多模態,而 Mistral 的文件指出其上下文視窗為 100 萬個 token,但 Artificial Analysis 在其測試的配置上讀到的數值為 524,288。權重承諾於 10 月底發布,授權條款則尚未公布名稱。
所以這不是較新的模型對上較舊的模型。這是專有前沿模型對上一個即將開放權重的挑戰者,而兩者的定價也相應反映這一點。

相同的索引,兩個模型
於10月6日從 Artificial Analysis 關於 Intelligence Index v4.3 的頁面上讀到:
• 智慧指數 — Mistral Large 4 Preview 38.4 對比 Claude Opus 5 50.8
• 每個索引任務的成本 — Mistral Large 4 Preview 為 $1.13,Claude Opus 5 為 $5.86
• Terminal-Bench 4.0 — 26.8% 對 49.0%,兩者之間最大的單一差距
人類最後的考試 — 35.0% 對 54.9%
• MMMU,多模態推理 — 76.2% vs 84.7%
• AutomationBench,商業工作流程 — 59.9% 對 56.6%,唯一由 Mistral Large 4 領先的一列
• 上下文視窗:Mistral 宣稱 1M,受測版本為 524,288,對比實際提供的 1M
• 預覽版的輸出上限尚未公佈,對比 128K tokens
• 每百萬價格,輸入/輸出 — 定價 $1.36/$4.18,目前促銷價 $0.68/$2.09,對比 $5.00/$25.00

這個模式清晰可辨。Opus 5 在兩個最困難、推理負擔最重的項目上領先——終端機作業和開放式知識——並且在多模態理解上也領先,儘管 Mistral Large 4 是以其視覺能力為賣點的模型。Mistral Large 4 在工作流程自動化項目上領先,而這是最接近業務單位要求模型去做的事情的項目,而且每項任務的價格只有五分之一。
Mistral Large 4 真正勝出之處
Mistral 發布文章中最有趣的主張,並不是某個基準測試分數。而是:在 Artificial Analysis Cyber Index 的其中一項測試中——重現開源軟體裡的實際漏洞,然後加以修補——Mistral Large 4 拿下 82%,據稱是所有模型中最高的;而且有數個領先的閉源模型在同一項測試中得分接近零,因為它們拒絕執行這項任務。Mistral 點名 Claude Opus 5.5 和 GPT-6 Astra 作為這種拒絕的例子。
那是廠商對廠商所引用數據的解讀,也理應以這種角度來看待。如果這一點成立,那就是一項真實的作業差異:無法重現某個漏洞的模型,就無法用來證明該漏洞確實存在,而這正是多數事件應變作業的核心。Mist 將這個 82% 與其在 Cybench 40 項競賽練習中 82% 的成績配對,並提出反向主張,指其在取自 JailbreakBench、StrongREJECT 與 AgentHarm 的網路相關題目上的拒答率高於其他開放權重模型——其論點是,你想要的是同一個模型同時具備能力與紀律,而不是以其中一項換取另一項。
除了資安之外,Mistral Large 4 的立論建立在三件 Opus 5 並未提供的事上。它是在歐洲法律之下、於歐洲基礎設施上訓練並提供服務,這對有資料駐留義務的買家來說至關重要。Mistral 承諾,它將可供下載——這是整件事的重點,因為自我部署正是能消除 Mistral 極力描述的事件中途存取風險。而且它每項任務的成本低到足以把它當作第一輪處理、再將困難的殘餘部分升級交給前沿模型,在經濟上是合理的,而不是一個可忽略的零頭。
Claude Opus 5 仍然物有所值之處
12 點的指數差距並不小,而逐列呈現的樣貌說明了它落在哪裡。Terminal-Bench 4.0 幾乎是兩倍——49.0% 對上 26.8%——而終端機工作是代理式編碼最接近的公開替代指標,而這正是今年多數團隊採購前沿模型的主要用途。Humanity's Last Exam 則以 20 點將兩者區隔開來。在長時程自主性方面,Opus 5 的自適應推理設計、其 128K 輸出上限,以及實際提供的 1M 脈絡,正是當你的工作負載是長達數小時的代理工作階段、而非單一難題時所該採用的配置。
輸出上限是較不明顯的差異。Mistral 尚未公布此預覽版的最大輸出長度,而 Opus 5 的 128K 對程式碼生成與長篇結構化文件而言,確實能解除限制。如果你的管線產出的是檔案而非答案,在切換前先確認那個數字,因為這種落差往往只會在正式環境中浮現。
每項任務成本是值得緊盯的數字
每個 token 的價格會美化便宜模型,並讓人對昂貴模型產生誤解。該指數自身的每項任務成本——完成一項評估任務的總支出,包含快取及所有開銷——才是經得起預算考驗的數字:1.13 美元對上 5.86 美元。
那不是把所有工作都轉到較便宜模型的許可,因為便宜模型失敗的任務,是你付兩次錢的任務。它是停止把單一前沿模型視為唯一選項的許可。在 OrcaRouter上,Claude Opus 5 以供應商的定價、0% 加成列於目錄中,與其他 200 多個模型共用同一個 OpenAI 相容端點,這正是讓雙模型管線只需一個下午就能完成、而不必再簽一份供應商合約的原因。Mistral Large 4 目前不在目錄中——預覽版要透過 Mistral 自家的 API 及數個第三方平台才能取得。當它的權重發布、並有供應商代為託管時,同樣的原價轉嫁規則便適用:供應商收多少,就向你收多少,而供應商降價,當天就會反映在你的帳單上。

對於未經實證的預覽版,最重要的路由功能就是容錯移轉。把一部分正式環境流量送到 Mistral Large 4,同時由 Opus 5 承接其餘流量,這意味著一旦出現效能退步,會變成重新導向而非服務中斷,而且你是在自己的資料上、而不是在排行榜上,認識到這個模型真正的失效模式。
什麼能在三週內解決這件事?
有三項事實仍未定,而每一項都會改變答案。如果權重以寬鬆授權釋出,Mistral Large 4 就會成為這對模型中唯一你能自行託管的模型,而受監管買家的盤算會大幅傾斜。如果促銷價 $0.68 / $2.09 回復為價目表上的 $1.36 / $4.18,每項任務的差距會縮小,但仍是決定性的。而如果 Artificial Analysis 將其私下評估的程式設計數據原封不動地移到公開指數上,那麼程式設計方面的說法就會變成由第三方驗證,而不是由供應商假第三方之名發布。
在那之前:Opus 5 是安全的生產環境預設選擇,對於代理式與終端機密集型工作而言,值得付出其較高的價格倍數。Mistral Large 4 則是有趣的押注——每項任務的成本夠低,足以與之並行運行;在自動化與資安方面能力夠強,今天就能掙得流量;而且還承諾可自我部署,這是本比較中任何封閉模型都無法比擬的。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
