
Mistral Large 4 與 DeepSeek V4 Pro:孿生架構,相反的押注
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 151 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 120 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
這次比較中的兩個模型在紙面上幾乎一模一樣,實際表現卻天差地遠。Mistral Large 4是一個擁有 1.05 兆參數的稀疏專家混合模型,其中 490 億為活躍參數,於 2026 年 10 月 6 日發表。DeepSeek V4 Pro是一個擁有 1.6 兆參數的稀疏專家混合模型,其中 490 億為活躍參數,於 2026 年 4 月 24 日發布。相同的激活預算、相同的架構家族、同樣宣稱以開放權重經濟性達到前沿效能——而其中恰好只有一個是你今天就能下載權重的。
這組對比並非本文發明。Mistral 自家的發布文章在三處明確以 DeepSeek V4 Pro 為基準進行評測:代理式編碼、長時程知識工作,以及商業流程自動化。反過來對另一方提出同樣的問題——DeepSeek V4 Pro 已經做到哪些 Mistral Large 4 所承諾的事——結果證明,這是看清這次預覽版究竟新增了什麼的最快方法。
規格,並排對照
於 10 月 6 日讀取,Mistral 的數據來自其自家公告與模型卡,DeepSeek 的數據則來自其即時目錄條目:
• 總參數 vs 活躍參數 — 總計 1.05T / 活躍 49B,對比總計 1.6T / 活躍 49B
• 模態 — 文字與圖像輸入、文字輸出 vs 僅文字
• 上下文視窗 — Mistral 聲稱 1M,Artificial Analysis 正在測試的配置為 524,288,對比實際提供的 1M
• 輸出上限 —— 預覽版未公布,相較於 384K tokens
• 每百萬價格,輸入/輸出 — 定價 $1.36 / $4.18,目前促銷價 $0.68 / $2.09,對比 $0.66 / $1.98
• 每百萬快取輸入 — $0.14,目前為 $0.07,對比 $0.022
• 權重 — 承諾十月底推出,授權未指明 對比 現已可用
• 訓練基礎設施 — Mistral 自家歐洲資料中心內的 3,800 顆 NVIDIA Grace Blackwell GPU,對比 DeepSeek 自家的叢集

49B 活化參數這個數字的對稱性既是頭條,也是陷阱。活躍參數決定生成一個 token 的成本;總參數決定模型知道什麼。DeepSeek 的 1.6T 對上 Mistral 的 1.05T,意味著 DeepSeek 每計算一個 token 所承載的容量大約多出 50%——這在知識密集的工作中是真正的優勢,而在瓶頸是遵循指令或工具使用的任務中則毫無優勢。
獨立指數說明了什麼
兩款模型在 Artificial Analysis 上都有頁面,這使本次成為該系列中少數雙方是以同一套測試框架衡量的比較之一。Intelligence Index v4.3,於 10 月 6 日讀取:
智慧指數 — Mistral Large 4 Preview 為 38.4,對比 DeepSeek V4 Pro 0813 的 36.0
• 每項索引任務成本 — $1.13 對比 $0.67
Terminal-Bench 4.0 — 26.8% 對比 14.1%
• 人類的最後考試 — 35.0% 對 41.0%
• AutomationBench,業務工作流程 — 59.9% 對 56.7%
• τ²-Bench,工具使用代理 — 預覽版未公佈,相較於 96.2%
• SciCode — 54.2% 對比 51.0%
這場競爭遠比價格標籤所暗示的更加緊繃,而其中的分歧具有資訊價值,並非雜訊。Mistral Large 4 在代理式程式編寫項目以近 13 個百分點勝出,並在工作流程自動化項目以些微差距勝出;DeepSeek V4 Pro 則在開放式知識項目以 6 個百分點勝出,且每項任務成本低 40%。另請注意,該指數會將成本分攤到快取讀取、快取寫入、推理 token 與答案 token 上——Mistral 的快取有 90% 折扣,DeepSeek 的快取則有 97% 折扣,這正是為什麼兩款名目費率相近的模型,每項完成任務的實際成本分別落在 $1.13 與 $0.67。

DeepSeek V4 Pro 已經勝出之處
決定性的差異不在於基準測試。而在於 DeepSeek V4 Pro 今天就已開放權重,而 Mistral Large 4 只是由該公司自家叢集所提供的預覽版。Mistral 表示權重會在十月底釋出——那是一項承諾,而非已存在的產物。其 Hugging Face 組織在10月6日查核時,沒有任何比7月更新的內容。除非出現一個附有授權檔案的儲存庫,否則 Mistral 所主張的自我部署論點,仍屬於 DeepSeek。
第二個差異是可用性廣度。DeepSeek V4 Pro 自四月起即可供路由使用,而且以相當大的差距,是我們自家模型目錄中使用量最高的模型——在撰寫本文時,過去七天內達到 11.3 億個 token,相較之下,典型前沿模型只處理數千萬個。那樣的用量對買家的重要性,是排行榜無法比擬的:這代表失效模式已知、吞吐量特性已知,而且提供該模型的供應商,已經過其他人正式環境流量的壓力測試。
DeepSeek 在這些枯燥的機制上也勝出。384K 輸出上限,對比一個未公開的上限;提供 1M 上下文,而非只是宣稱;以及純文字範疇,讓長上下文吞吐量變得可預測。如果你的工作負載是文件分析、長篇生成,或超過百萬詞元的知識密集擷取,DeepSeek V4 Pro 在每個層面上都比 Mistral 預覽版更便宜、更開放,也更經得起驗證。
在哪些情況下 Mistral Large 4 是更好的選擇
Mistral 精心挑選了它用來評測的項目列,而程式設計方面的差距並非表面問題。在 Terminal-Bench 4.0 上,26.8% 對 14.1% 大約是兩倍,這也與 Mistral 聲稱在 DeepSWE v1.1 上達 61.7%、在 SWE-Atlas-QnA 上達 59.4% 相符——它表示這些數字是 Artificial Analysis 在該測試框架公開發布前私下評估的,這就是它們尚未出現在公開指數上的原因。當這些數字公開、或最終未能公開時,就能為程式設計這個問題給出答案。
多模態是第二個明顯的分野。Mistral Large 4 原生支援圖像,配備專用的 1.6B 視覺編碼器,而 Mistral 聲稱其在開源模型中具備最先進的視覺定位能力——指出在 Dense 200 上達到 42%,對比 GPT-6 Astra 的 41%。DeepSeek V4 Pro 僅支援文字,其產品目錄卡也明確如此標示。任何涉及螢幕截圖、工程圖、掃描申報文件或圖表判讀的流程,這裡只有一個候選者,而不是兩個。
再來是資安領域,Mistral 的說法比 DeepSeek 已發表的任何內容都更明確:在要求模型重現真實漏洞並加以修補的 Artificial Analysis Cyber Index 測試中拿下 82%,據稱是所有模型中最高的;在 Cybench 的競賽練習中則有 93%。這些是廠商引用的數字,理應如此標註——但它們所依據的是獨立指數,而 DeepSeek 尚未發表可比的結果。就資安工作而言,誠實的立場是:Mistral Large 4 所宣稱的領先地位,尚未被證明為不實。
最後一項差異在於司法管轄權。Mistral 在自家歐洲資料中心以 3,800 顆 Grace Blackwell GPU 訓練該模型,並在當地提供預覽版,其歐洲部署從頭到尾都在歐洲法律下營運。對歐洲受監管買家而言,若替代選擇是中國的開放權重模型或美國的封閉模型,這可說是自成一類。
定價,請正確解讀
兩款模型的標價都不是全貌。DeepSeek V4 Pro 的價目表項目帶有兩個時段——01:00–04:00 與 06:00–10:00 UTC——在這些時段內,表列費率會乘以倍數,因此落在這些時段的工作負載,成本會是標示價格的兩倍。Mistral Large 4 的 $0.68 / $2.09 是相對於 $1.36 / $4.18 價目表的上市促銷價;促銷價是今天的價格,而價目表才是你應該用來估算帳單的價格。
OrcaRouter 釐清這一點的關鍵在於直通式定價:對供應商定價加價 0%,這意味著供應商降價,你當天就跟著降價,而供應商的促銷費率會直接轉嫁,而不是被吸收。DeepSeek V4 Pro 今天就能透過單一 OpenAI 相容端點、以其供應商費率進行路由,並與其他 200 多個模型使用同一組憑證,當某家供應商效能下降時,還會自動跨供應商容錯移轉。Mistral Large 4 不在我們的目錄中——其預覽版是透過 Mistral 自家的 API 和幾個第三方平台取得——所以如果你今天想同時跑這個比較的兩邊,那就代表一條走我們的線路,一條直接連。

該選哪一個
如果你需要可自行持有的權重、384K 輸出、百萬 token 的服務上下文、在兩者中每完成一項任務的最低成本,以及一個行為已在生產環境中被其他人打破過的模型,DeepSeek V4 Pro 就不是妥協——它是成品,而對方只是預告片。對文件、知識與長篇工作而言,它是正確的預設選擇;其開放權重也意味著,你能用它做到什麼的上限取決於你自己的基礎設施,而不是供應商的路線圖。
如果你的工作負載是代理式編碼,如果它涉及圖像,如果它涉及安全工作,或者如果歐洲司法管轄區是必要條件而非偏好,那麼 Mistral Large 4 就是值得冒預覽風險的模型——而且風險有界,因為 Mistral 已承諾權重,並承諾了一個有明確結束時間的紅隊演練窗口。現在就把一部分流量導向它,其餘流量留給 DeepSeek V4 Pro,讓兩者在你的資料上解決架構問題。49B 啟用預算從哪一方來看都會顯得一樣;不同的是它周遭的一切。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
