為文章《Mistral Large 4 Is a 1T-Parameter Preview》生成的一張標題卡,以粗體幾何無襯線字體顯示標題,下方有副標題「The weights have dropped」,以及上方一排三個扁平圖示——一個閉合的掛鎖、一個變灰的下載箭頭和一個盾牌——背景為白色,帶有藍色與青色漸層點綴,右下角有 OrcaRouter 標誌。
Guides & Insights

Mistral Large 4 是 1T 參數的預覽版:權重尚未釋出

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Mistral Large 4於2026年10月6日以公開預覽形式登場——這是一個擁有1兆參數的混合專家模型,具備490億個活躍參數、一個16億參數的視覺編碼器,且其開發商聲稱它是在中國以外打造的最強開放權重模型。尚未到位的,則是「開放權重」一詞所描述的部分。目前沒有可下載的模型檢查點、沒有授權檔案,也沒有儲存庫。Mistral表示,權重會在「本月底」釋出,在此之前有一段紅隊測試期;在這段期間,經過審查的合作夥伴與國家主管機關會取得一個解鎖版本,其內容審核較寬鬆,並具備擴增的網路能力。因此,本週對 Mistral Large 4 最準確的描述是:一個你可以呼叫的預覽 API,以及一個你還無法擁有的模型。

那個分野本身就是故事主體,而不是故事的註腳。Mistral 在發布消息時一併公布的每一項數字——程式碼評分、資安評分、財務與法律評估——都是在一個仍在持續變動的版本上產生的,而每一個拿它與封閉式前沿模型相比的標題,所比較的都是一個不會是你實際下載到的那個產物。面對這樣一場發布,有用的做法是把今天你能驗證的東西,與要求你憑信心接受的東西區分開來,而 mistral.ai 自家的文章對於哪個屬於哪一類,難得地交代得格外大方。

10月6日實際上線的是什麼?

預覽 API 已在 Mistral Studio 上線,模型 ID 為 mistral-large-4-0。Mistral 自家的模型卡將其描述為「最先進、開放權重、通用多模態模型」,建構於細粒度 MoE 架構上,並將參數量細分為 490 億啟用參數,總參數為 1.05 兆,另加視覺編碼器。該公司在其歐洲自有資料中心內,以 3,800 顆 NVIDIA Grace Blackwell GPU 從零開始訓練;預覽版也部署在同一套基礎設施上——這是 Mistral 極力宣揚的主權主張,力度不亞於其效能宣傳。

供應商所述的規格:

• 總參數量與活躍參數量 — 總計 1.05 兆,每個 token 有 490 億活躍參數,稀疏 MoE

• 模態 — 文字與圖像輸入,文字輸出;原生多模態,而非外掛式轉接器

• 上下文視窗 — Mistral 的文件指出為 100 萬個 token;Artificial Analysis 在其測試的組態上測得 524,288,因此應將 100 萬視為供應商上限,而非實際服務的視窗

• 價格 — 每百萬輸入詞元 $1.36、每百萬輸出詞元 $4.18,快取輸入為 $0.14,依 Mistral 公布的價目表

• 上市優惠 — 同一張卡片顯示劃掉的 $0.68 / $2.09 促銷價,並附 $0.07 的快取輸入,亦即半價

• 權重 — 尚未發布;根據公告,「本月底」

• 授權條款 — 在公告與文件頁面上皆未具名,而該頁面僅將該條目標示為「Open」

其中兩行值得讀兩遍。取決於你讀的是供應商還是第三方實驗室,上下文視窗會相差兩倍;這對一個服務配置仍在變動的預覽版來說並不罕見,但在你依此估算工作負載規模之前,仍值得先知道。而你要付的價格,取決於促銷費率能否撐過上市窗口;$1.36 / $4.18 是 Mistral 自家價目表列出的數字,$0.68 / $2.09 則是它目前收取的數字。在估算帳單時,請以前者為準。

A generated single-column scoreboard titled 'Mistral Large 4 Preview — the scoreboard', listing the API id mistral-large-4-0 and rows: Intelligence Index v4.3 38.4; cost per index task $1.13; Terminal-Bench 4.0 26.8%; Humanity's Last Exam 35.0%; MMMU-Pro 76.4%; context 1M stated by the vendor against 524,288 tested; input $1.36 now $0.68; output $4.18 now $2.09; cached input $0.14 now $0.07; weights promised end of October; licence unnamed; announced 6 October 2026. The footer reads that index and per-task figures are per Artificial Analysis Intelligence Index v4.3 read 6 October 2026, prices are per the vendor's own rate card, and AA still flags the model isOpenWeights: false.

基準測試數據,以及由誰執行

Mistral 的貼文對來源出處相當謹慎,而這份謹慎值得延續。三項備受矚目的代理式編碼數字——在 DeepSWE v1.1 上達 61.7%、在 SWE-Atlas-QnA 上達 59.4%,以及在 Terminal-Bench 4.0 上達 28.3%,綜合成 49.8% 的 Coding Agent Index 分數——用 Mistral 自己的話來說,是「由 Artificial Analysis 在該測試框架公開發布之前私下評估的數字」。它們尚未出現在 Artificial Analysis 的公開指數上。當該測試框架發布時,它們就會出現。在那之前,它們是廠商發布的數字,由第三方產生但尚未發布;這比大多數發布時的宣稱具有更強的來源出處,但仍然不等同於可重現的公開分數。

A screenshot of Mistral's own documentation, the Models Overview page at docs.mistral.ai, showing the GENERALIST MODELS card grid in which 'Mistral Large 4' is listed with a version tag of v26.10 and the description 'A state-of-the-art, open-weight, general-purpose multimodal model' — the description Mistral Large 3 beside it shares, while only Large 3 carries an APACHE 2.0 licence badge. Mistral Small 4, Mistral Medium 3.5, Z.ai GLM 5.3 and the Ministral 3 sizes are also visible, and the OCR MODELS section begins below.

今天什麼是公開且獨立的,從 Artificial Analysis 十月六日的模型頁面讀來:Mistral Large 4 Preview 得分38.4,於 Intelligence Index v4.3 上,每項任務約耗時 507 秒,Terminal-Bench 4.0 為 26.8%,長上下文推理為 81.3%。同一頁面將它列為開放權重模型,但事實上它並非開放權重——標記顯示為isOpenWeights: false,分類為「專有」,因為實際存在的,僅是由廠商自家叢集提供的預覽版。這個標記最能簡潔地說明本文所要探討的落差。

A screenshot of the Artificial Analysis model page for Mistral Large 4 Preview, showing the header describing it as a proprietary model released October 2026, percentile ranks of #64 of 225 for intelligence, #51 for speed, #56 for cost and #105 for verbosity, pricing of $1.36 in and $4.18 out with a 90% cache discount, an Intelligence Index of 38, a cost-per-task figure of $1.13, and a summary paragraph noting a 524k-token context window, text and image input, and roughly 200M tokens generated during the index run.

最值得引用的結果,是 Mistral 自己沒有親自跑的那一項。第三方標註公司 Surge AI 在隱藏模型身分的情況下,針對程式碼品質進行了盲測人工評估,專業標註人員在 1–5 分量表上給予 Mistral Large 4 Preview 3.74 分——五者中排名第二,領先 Kimi K3 的 3.59、GLM-5.3 的 3.60 與 GLM-5.2 的 3.40,僅次於 Claude Opus 5 的 4.22。由具名實驗室作為受測方的盲測人工評估,與自行執行的基準測試是不同類型的證據,而它是這則公告中最強的單一獨立資料點。

接著是網路安全領域,Mistral 在此提出最犀利的說法。在 Artificial Analysis 的網路指數(Cyber Index)上,該公司表示 Mistral Large 4 位列全球前五,並領先中國以外開發的開放權重模型。在一項特定測試中——重現開源軟體中的真實漏洞,然後加以修補——它拿下 82%,被形容為所有模型中最高,並在 Cybench 的 40 項競賽題目中取得 93%。Mistral 補充了一項尖銳的觀察:數個領先的閉源模型,Claude Opus 5.5與GPT-6 Astra都在點名之列,在同一項測試中得分接近零,因為它們拒絕執行該任務。在沒有第三方頁面擺在你面前的情況下,82% 只是廠商提供的數字;拒絕率論點則是廠商的解讀。兩者都看似合理,但今天都未經獨立證實。

為什麼預覽取景會改變價格計算

預覽版不只是階段標籤。這代表模型可以在比 GA 發行版更短的通知期內被重新指向、重新定價或淘汰,也代表你用來基準測試的服務配置,可能不是你部署時所面對的配置。對路由決策而言,這是實實在在的成本:一條針對本週組建調校的管線,會帶來一筆你未編列預算的重新驗證帳單。

在 OrcaRouter上,200 多個模型坐落在同一個 OpenAI 相容端點之後,以供應商的標價提供,0% 加價原封不動地直接反映,因此供應商自家價目表上的價格變動,當天就是我們這邊的價格變動——這點在這裡格外重要,因為這次發布推出兩種價格,其中一個劃上了刪除線。對一個未經實證的預覽版來說,自動容錯移轉是解答的另一半:它讓你能把一小部分正式環境流量放在 Mistral Large 4 上,同時由第一方模型承接其餘流量,因此一個在你的實際工作負載下出現退步的預覽版,會降級成一次重新路由,而不是一場事故。細心的讀者不該假設的是,Mistral Large 4 今天已經可以在 OrcaRouter 上路由。它並不在目錄中——這個預覽版是透過 Mistral 自家的 API 和幾個第三方平台存取的,而它的權重一旦推出,將是自行託管的選項。

這個 open open 目前是一個承諾

Mistral 的說法是,Mistral Large 4「將開放權重效能推向新前沿」,而開放權重是企業得以掌控模型的機制。對 Mistral 打算推出的模型來說,這是個站得住腳的論點。但對它本週實際推出的模型而言,這個機制卻不存在:沒有 Hugging Face 儲存庫、沒有授權條款文字、沒有可下載的檢查點。該公司自家的 Hugging Face 組織頁面在 10 月 6 日查看時,沒有比七月更新的內容,而其中最新的項目也與 Large 系列無關。

這不是對該計畫的批評;在紅隊演練期之後分階段釋出權重是一項連貫一致的政策,而 Mistral 對此明確表態。這是對那個形容詞的告誡。「開放權重」在一個權重還要四週才會釋出的段落裡發揮著行銷作用,而規範這些權重的授權條款尚未被指名。寬鬆授權與 Apache 式條款是其中一種結果;僅限研究或設有營收上限的授權則是另一種,而這份公告並未在兩者之間做出選擇。

十月底前要檢查什麼

有五件事會讓這份預覽成為既定事實,而且每一項都無須向 Mistral 詢問任何事就能查證:

• 一個隸屬於 Mistral 組織的 Hugging Face 儲存庫,內含檢查點與授權檔案——Mistral 承諾於本月發布的版本

• 授權條款名稱本身,決定了「開放權重」是指 Apache-2.0 式的自由,還是有使用上限的授權。

• 每 $0.68 / $2.09 的促銷費率是否維持,或回復為價目表上的 $1.36 / $4.18

• Artificial 是否會在推出時,將私下評估的程式編寫數據移到其公開指數,以及這些數據是否會維持在相同數值

• 實際提供的上下文視窗,目前由廠商列為 1M,而獨立實驗室則讀取為 524,288

在那些問題解決之前,面對 Mistral Large 4 的正確姿態,正是它自己的發布所邀請的那一種:呼叫它、在你的工作負載上衡量它,並讓正式生產路徑留在一個行為不會預定變更的模型上。權重才是重頭戲。預覽版只是預告片。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新