
Mistral Large 4 對比 Gemini 3.1 Pro:八個月,兩種方向
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 151 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 120 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
Gemini 3.1 Pro自 2026 年 2 月 19 日起已在市場上,至今仍在每一份廣泛能力排行榜上名列前茅,包括那些將它與今年秋季發布的模型相比的榜單。 Mistral Large 4最多只有三週大——於 2026 年 10 月 6 日宣布的預覽版,其權重承諾在 10 月底發布,且未指明授權條款。在 10 月 6 日讀取的 Artificial Analysis 的 Intelligence Index 上,已問世八個月的 Gemini 3.1 Pro 得分為 29.7,而這位新進者為 38.4。這是這項比較誠實的起點,而且與發布日期所暗示的正好相反。
這個解釋並不神祕。Gemini 3.1 Pro 是預覽產品線的旗艦,Google 從未將它提升為穩定版,而 Artificial Analysis 為它設立的頁面標示為「Gemini 3.1 Pro Preview」——同一頁面上,較低的指數就緊鄰著頂尖的 GPQA Diamond 分數。它是一款為廣度而打造的模型:超大的上下文視窗、廣泛的模態支援,以及在知識型問題上表現強勁的推理能力。Mistral Large 4 則完全是為另一幅世界版圖而打造,定價也相應反映了這一點。
每一項是什麼
Gemini 3.1 Pro 是 Google 的前沿多模態推理模型,API id 為 gemini-3.1-pro-preview,具備 1,048,576 個權杖的上下文視窗,以及 65,536 個權杖的輸出上限。它接受文字、圖片、影片、音訊與檔案。它由 OrcaRouter 的目錄提供,並採用 Google 自家的費率。Google 的文件並未列出任何非預覽版的 Gemini 3.1 Pro;預覽版名稱就是該產品。
Mistral Large 4 是一個擁有 1.05 兆參數的稀疏混合專家模型,具備 490 億個作用中參數,以及專用的 16 億參數視覺編碼器,以「Mistral Large 4 Preview」的名稱、透過 API 識別碼 mistral-large-4-0 提供。Mistral 的文件指出其上下文視窗為 100 萬個 token;Artificial Analysis 在其測試的配置上讀取到 524,288。最大輸出並未公布。Mistral 將其描述為迄今規模最大、能力最強的模型,並表示權重將於十月底推出。
這些數字,並附上其出處
兩個模型都有獨立頁面,因此下方的比較是同一測試框架下的比較,而非廠商對廠商的比較:
• 智慧指數 v4.3 — Mistral Large 4 Preview 38.4 對比 Gemini 3.1 Pro 29.7
• 每個索引任務的成本 — $1.13 對比 $1.30
• 長上下文推理 — 81.3% 對 82.0%
• GPQA Diamond — 預覽版未公布,對比 94.1%
人類最終考試 — 35.0% 對比 47.0%
• Terminal-Bench 4.0 — 26.8% 對 4.0%
• SciCode — 54.2% 對比 58.7%
• AutomationBench,業務工作流程 — 59.9% 對 35.4%
• MMMU-Pro,多模態推理 — 76.4% 對 82.4%
• 上下文視窗 — 標稱 1M / 實測 524,288,對比實際提供 1,048,576
• 輸出上限 — 未公佈 vs 65,536 個 Token
• 每百萬 Token 價格,輸入/輸出 — 定價 $1.36 / $4.18,促銷價 $0.68 / $2.09,相較於 200K Token 以下為 $2.00 / $12.00,超過 200K Token 為 $4.00 / $18.00
• 權重 — 已承諾,授權未具名,相較於專有

最引人注目的一列是 Terminal-Bench 4.0。Gemini 3.1 Pro 得分 4.0%——不是打錯字,也不是表格中的幻覺:這反映的是一個二月發表的模型,被放到一個比它更晚出現的終端機代理測試框架上運行。Mistral Large 4 的 26.8% 在同一項測試中則是六倍之高。任何因為一個舊的代理式編碼分數而排除 Gemini 的人,都應該根據它的 GPQA Diamond 把它重新納入考慮;而任何因為指數排名而排除 Mistral 的人,應該先看看終端機那一列。
Gemini 3 Pro 仍佔上風的地方
知識與廣度。94.1% 的 GPQA Diamond 是本文所有數據中最高的,無論是哪一方,而它是研究所程度的科學基準——不是模型靠嘴上功夫就能達到的數字。Humanity's Last Exam 的 47.0% 對比 35.0%,以及 SciCode 分數略勝這位新進者,都說明了同一件事。如果你的工作負載是從知識語料庫中準確回答困難問題,那麼 Gemini 3.1 Pro 在發布八個月後仍是更強的模型。
模態廣度是第二項優勢。Gemini 3.1 Pro 除了文字與圖像,還能處理影片與音訊。Mistral Large 4 則只接受文字與圖像。如果你的流程需要攝取錄製的會議、螢幕錄影或感測器音訊,這裡只有一個模型能看見完整的輸入。
輸出上限是第三個。65,536 個 token 是已公布、保證的上限;Mistral 完全沒有為預覽版公布任何上限。沒有什麼比未說明的輸出限制,更可能在正式環境中反咬你一口。
而 Gemini 的上下文視窗確實是實實在在以 1,048,576 個 token 提供服務,相對地,Mistral 的 1M 則是廠商標稱數字,對照獨立實測的 524,288。對於落在視窗最末端的工作負載而言,標稱數字與實測數字之間的差距,就是得改寫。
Mistral Large 4 在何處改變決策
代理式工作,特別是任何涉及終端機的部分,正是這兩款模型不再能相提並論的地方。Mistral 自家的發布文章將 DeepSWE v1.1 的 61.7%、SWE-Atlas-QnA 的 59.4% 以及 Terminal-Bench 4.0 的 28.3% 彙整成 49.8% 的 Coding Agent Index,並明確表示在該綜合指標上領先 DeepSeek V4 Pro 0813 與 Qwen3.8 Max。用 Mistral 的話來說,那三項數字是 Artificial Analysis 在其測試框架公開前私下評估的結果;它們尚未列入公開指數,在列入之前應標示為廠商自行公布。
獨立證據也指向同一個方向。在 AutomationBench 上——涵蓋 Gmail、Sheets、Slack 與 Salesforce 的 657 個商業工作流程——Mistral Large 4 得分 59.9%,領先 Kimi K3、MiMo-V2.6-Pro 與 DeepSeek V4 Pro;而在同一套測試框架上,Gemini 3.1 Pro 完全沒有出現,因為該基準測試的推出時間晚於它。Surge AI 執行的一項盲測人類研究中,Mistral Large 4 Preview 在五個模型的程式碼品質評比中名列第二,得分 3.74,領先 GLM-5.3 與 Kimi K3,僅次於 Claude Opus 5。
資安方面的宣稱是 Mistral 貼文中最犀利的一項,值得精確引述:在 Artificial Analysis Cyber Index 測試中達到 82%,該測試要求模型重現真實漏洞並加以修補,並被描述為所有模型中最高;在 Cybench 的 40 項競賽練習中達到 93%;以及 Mistral 聲稱,它在整體 Cyber Index 上名列全球前五,同時領先中國以外開發的開放權重模型。這些都是廠商引述、出自獨立指數的數字。它們的實際優勢在於,Mistral 打造這個模型是為了讓它執行工作,而不是拒絕去做。
表中最低價的一行也屬於 Mistral,但僅是略微領先:每項任務 1.13 美元對上 1.30 美元,這是促銷費率所帶來的 13% 優勢,而標準價目表會抹除這項優勢。Gemini 3.1 Pro 是採用 2026 年定價的 2026 年模型,用它來執行索引任務並不昂貴。
無人做基準測試的決勝關鍵
有兩件事正在發揮作用,而那些表格無法呈現。第一件是授權。Gemini 3.1 Pro 是專有軟體,而且將一直如此;Mistral Large 4 則是一個預覽版,其整套賣點在於它會成為可下載的成品,讓你能在自己的政策下、在自己的硬體上、依歐洲法律運行——Mistral 在自己的資料中心用 3,800 顆 Grace Blackwell GPU 訓練它,並在那裡提供預覽服務。在儲存庫出現、授權條款有了名字之前,這套說法一文不值。等到那一天成真,它就價值連城。

第二個是營運風險。仍在打磨中的預覽版會在你腳下變動。在 OrcaRouter 上,這個比較的兩邊都可透過單一 OpenAI 相容端點,以供應商定價、0% 加價取得——Gemini 3.1 Pro 已以 Google 的價格在目錄中上線,而 Mistral Large 4 則必須透過 Mistral 自家的 API 與幾個第三方平台才能觸及,因為那不是我們提供的路由。這裡真正有用的是路由 DSL:把分類與擷取交給當週較便宜的那個模型,把難纏的殘餘升級上去,並讓自動容錯移轉去吸收預覽版的壞日子,而不是讓你的待命輪值去吸收。

裁決結果
要問的是工作負載是什麼,而不是哪個模型比較好。就知識工作、音訊與視訊輸入、有保證的輸出上限,以及可提供的百萬詞元窗口而言,Gemini 3.1 Pro 仍是較強的模型,而它的年資不是缺陷——那是其他人花了八個月摸清它極限的成果。就代理式程式開發、終端機作業與安全營運而言,Mistral Large 4 領先的幅度大到讓排行榜名次顯得有誤導性,而且它是這兩者中唯一可能最終可供自行架設的。
值得關注的決勝關鍵是十月底。如果權重以寬鬆授權釋出,Mistral Large 4 就不再在價格上與 Gemini 3.1 Pro 競爭,而是開始在控制權上與它競爭,而那是另一場不同的戰爭。如果它們以限制性授權釋出,本文的答案不會有太大改變——但理由會變。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
