為文章「Mistral Large 4 vs Claude Opus 5」生成的一張標題卡,以粗體幾何無襯線字體顯示標題,下方為副標題「差距比價格差距還小」,上方有一排三個扁平線性圖示——兩個高度不等的長條、一個價格標籤和一個人類評分尺度——背景為白色,帶有藍色與青色的漸層點綴,右下角有 OrcaRouter 標誌。
Guides & Insights

Mistral Large 4 對上 Claude Opus 5:差距比價格差距還小

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

任何人發表過的唯一正面對決數字,針對Mistral Large 4對上Claude Opus 5,來自一項盲測人工評估,而且比基準測試表所顯示的還接近。Surge AI 隱藏了模型身分,要求專業標註人員以 1–5 分量表評分程式碼輸出;Claude Opus 5 以 4.22 排名第一,Mistral Large 4 Preview 以 3.74 排名第二,領先 Kimi K3、GLM-5.3 與 GLM-5.2。在獨立彙總指標上,兩者根本差距懸殊——在 10 月 6 日讀取的 Artificial Analysis 的 Intelligence Index 上,分別是 50.8 對 38.4。這組配對值得花一個下午研究的原因在於,分數低了 12 分的模型,執行一項任務的成本大約只有五分之一。

這兩個數字都需要附上其來源出處,因為它們並非同一類型的數字。Surge AI 的評估是 Mistral 委託並發表的第三方人類研究——這比自行執行的基準測試是更強有力的證據形式,而且仍然是一份由 Mistral 掌控其發表的研究。指數分數則是 Artificial Analysis 自行執行的結果,彼此之間可互相比較,因此才是適合用來推理的一對。兩者都無法告訴你該以哪個模型為基礎來開發;但兩者合起來則界定了這個問題的範圍。

兩個產品,而非同一產品的兩個世代

Claude Opus 5 是該廠商的封閉權重旗艦模型,於 2026 年 7 月 24 日發布,提供 1M token 的上下文視窗與最高 128K 的輸出 token,定價為每百萬輸入 token 5 美元、每百萬輸出 token 25 美元,快取讀取則為 0.50 美元。它是該廠商 Opus 系列中能力最強的模型,明確定位於長時程的代理式工作——在多步驟的作業階段中大量使用工具,仍能保持連貫一致。

Mistral Large 4 是一個預覽版,於 2026 年 10 月 6 日發布,Mistral 將其描述為一個 1.05 兆參數的稀疏混合專家模型,具有 490 億個活躍參數與一個 16 億參數的視覺編碼器。其 API id 為 mistral-large-4-0,原生支援多模態,而 Mistral 的文件指出其上下文視窗為 100 萬個 token,但 Artificial Analysis 在其測試的配置上讀到的數值為 524,288。權重承諾於 10 月底發布,授權條款則尚未公布名稱。

所以這不是較新的模型對上較舊的模型。這是專有前沿模型對上一個即將開放權重的挑戰者,而兩者的定價也相應反映這一點。

A screenshot of Mistral's own documentation, the Models Overview page at docs.mistral.ai, showing the GENERALIST MODELS card grid in which 'Mistral Large 4' is listed at version v26.10 with the description 'A state-of-the-art, open-weight, general-purpose multimodal model' and no licence badge, beside a Mistral Large 3 card at v25.12 that does carry an APACHE 2.0 badge. Mistral Small 4, Mistral Medium 3.5, Z.ai GLM 5.3 and the Ministral 3 sizes are also visible, with the OCR MODELS section starting below.

相同的索引,兩個模型

於10月6日從 Artificial Analysis 關於 Intelligence Index v4.3 的頁面上讀到:

• 智慧指數 — Mistral Large 4 Preview 38.4 對比 Claude Opus 5 50.8

• 每個索引任務的成本 — Mistral Large 4 Preview 為 $1.13,Claude Opus 5 為 $5.86

• Terminal-Bench 4.0 — 26.8% 對 49.0%,兩者之間最大的單一差距

人類最後的考試 — 35.0% 對 54.9%

• MMMU,多模態推理 — 76.2% vs 84.7%

• AutomationBench,商業工作流程 — 59.9% 對 56.6%,唯一由 Mistral Large 4 領先的一列

• 上下文視窗:Mistral 宣稱 1M,受測版本為 524,288,對比實際提供的 1M

• 預覽版的輸出上限尚未公佈,對比 128K tokens

• 每百萬價格,輸入/輸出 — 定價 $1.36/$4.18,目前促銷價 $0.68/$2.09,對比 $5.00/$25.00

A generated two-column scoreboard titled 'Mistral Large 4 vs Claude Opus 5 — the scoreboard'. Left column 'Mistral Large 4 Preview': Intelligence Index v4.3 38.4; cost per index task $1.13; Terminal-Bench 4.0 26.8%; Humanity's Last Exam 35.0%; MMMU-Pro 76.4%; AutomationBench 59.9%. Right column 'Claude Opus 5': Intelligence Index v4.3 50.8; cost per index task $5.86; Terminal-Bench 4.0 49.0%; Humanity's Last Exam 54.9%; MMMU-Pro 84.7%; AutomationBench 56.6%.

這個模式清晰可辨。Opus 5 在兩個最困難、推理負擔最重的項目上領先——終端機作業和開放式知識——並且在多模態理解上也領先,儘管 Mistral Large 4 是以其視覺能力為賣點的模型。Mistral Large 4 在工作流程自動化項目上領先,而這是最接近業務單位要求模型去做的事情的項目,而且每項任務的價格只有五分之一。

Mistral Large 4 真正勝出之處

Mistral 發布文章中最有趣的主張,並不是某個基準測試分數。而是:在 Artificial Analysis Cyber Index 的其中一項測試中——重現開源軟體裡的實際漏洞,然後加以修補——Mistral Large 4 拿下 82%,據稱是所有模型中最高的;而且有數個領先的閉源模型在同一項測試中得分接近零,因為它們拒絕執行這項任務。Mistral 點名 Claude Opus 5.5 和 GPT-6 Astra 作為這種拒絕的例子。

那是廠商對廠商所引用數據的解讀,也理應以這種角度來看待。如果這一點成立,那就是一項真實的作業差異:無法重現某個漏洞的模型,就無法用來證明該漏洞確實存在,而這正是多數事件應變作業的核心。Mist 將這個 82% 與其在 Cybench 40 項競賽練習中 82% 的成績配對,並提出反向主張,指其在取自 JailbreakBench、StrongREJECT 與 AgentHarm 的網路相關題目上的拒答率高於其他開放權重模型——其論點是,你想要的是同一個模型同時具備能力與紀律,而不是以其中一項換取另一項。

除了資安之外,Mistral Large 4 的立論建立在三件 Opus 5 並未提供的事上。它是在歐洲法律之下、於歐洲基礎設施上訓練並提供服務,這對有資料駐留義務的買家來說至關重要。Mistral 承諾,它將可供下載——這是整件事的重點,因為自我部署正是能消除 Mistral 極力描述的事件中途存取風險。而且它每項任務的成本低到足以把它當作第一輪處理、再將困難的殘餘部分升級交給前沿模型,在經濟上是合理的,而不是一個可忽略的零頭。

Claude Opus 5 仍然物有所值之處

12 點的指數差距並不小,而逐列呈現的樣貌說明了它落在哪裡。Terminal-Bench 4.0 幾乎是兩倍——49.0% 對上 26.8%——而終端機工作是代理式編碼最接近的公開替代指標,而這正是今年多數團隊採購前沿模型的主要用途。Humanity's Last Exam 則以 20 點將兩者區隔開來。在長時程自主性方面,Opus 5 的自適應推理設計、其 128K 輸出上限,以及實際提供的 1M 脈絡,正是當你的工作負載是長達數小時的代理工作階段、而非單一難題時所該採用的配置。

輸出上限是較不明顯的差異。Mistral 尚未公布此預覽版的最大輸出長度,而 Opus 5 的 128K 對程式碼生成與長篇結構化文件而言,確實能解除限制。如果你的管線產出的是檔案而非答案,在切換前先確認那個數字,因為這種落差往往只會在正式環境中浮現。

每項任務成本是值得緊盯的數字

每個 token 的價格會美化便宜模型,並讓人對昂貴模型產生誤解。該指數自身的每項任務成本——完成一項評估任務的總支出,包含快取及所有開銷——才是經得起預算考驗的數字:1.13 美元對上 5.86 美元。

那不是把所有工作都轉到較便宜模型的許可,因為便宜模型失敗的任務,是你付兩次錢的任務。它是停止把單一前沿模型視為唯一選項的許可。在 OrcaRouter上,Claude Opus 5 以供應商的定價、0% 加成列於目錄中,與其他 200 多個模型共用同一個 OpenAI 相容端點,這正是讓雙模型管線只需一個下午就能完成、而不必再簽一份供應商合約的原因。Mistral Large 4 目前不在目錄中——預覽版要透過 Mistral 自家的 API 及數個第三方平台才能取得。當它的權重發布、並有供應商代為託管時,同樣的原價轉嫁規則便適用:供應商收多少,就向你收多少,而供應商降價,當天就會反映在你的帳單上。

A screenshot of the OrcaRouter model page for anthropic/claude-opus-5, showing the model identity, a 1M-token context window, a 128K maximum output, input modalities of text, image and file with text output, the pre-October-2026 release date, a p-50 time-to-first-token figure of 4.82 seconds, pricing of $5.00 per million input and $25.00 per million output, and an OpenAI-compatible code sample pointing at the api.orcarouter.ai base URL.

對於未經實證的預覽版,最重要的路由功能就是容錯移轉。把一部分正式環境流量送到 Mistral Large 4,同時由 Opus 5 承接其餘流量,這意味著一旦出現效能退步,會變成重新導向而非服務中斷,而且你是在自己的資料上、而不是在排行榜上,認識到這個模型真正的失效模式。

什麼能在三週內解決這件事?

有三項事實仍未定,而每一項都會改變答案。如果權重以寬鬆授權釋出,Mistral Large 4 就會成為這對模型中唯一你能自行託管的模型,而受監管買家的盤算會大幅傾斜。如果促銷價 $0.68 / $2.09 回復為價目表上的 $1.36 / $4.18,每項任務的差距會縮小,但仍是決定性的。而如果 Artificial Analysis 將其私下評估的程式設計數據原封不動地移到公開指數上,那麼程式設計方面的說法就會變成由第三方驗證,而不是由供應商假第三方之名發布。

在那之前:Opus 5 是安全的生產環境預設選擇,對於代理式與終端機密集型工作而言,值得付出其較高的價格倍數。Mistral Large 4 則是有趣的押注——每項任務的成本夠低,足以與之並行運行;在自動化與資安方面能力夠強,今天就能掙得流量;而且還承諾可自我部署,這是本比較中任何封閉模型都無法比擬的。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新