
Mistral Large 4 是 1T 參數的預覽版:權重尚未釋出
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 151 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 120 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
Mistral Large 4於2026年10月6日以公開預覽形式登場——這是一個擁有1兆參數的混合專家模型,具備490億個活躍參數、一個16億參數的視覺編碼器,且其開發商聲稱它是在中國以外打造的最強開放權重模型。尚未到位的,則是「開放權重」一詞所描述的部分。目前沒有可下載的模型檢查點、沒有授權檔案,也沒有儲存庫。Mistral表示,權重會在「本月底」釋出,在此之前有一段紅隊測試期;在這段期間,經過審查的合作夥伴與國家主管機關會取得一個解鎖版本,其內容審核較寬鬆,並具備擴增的網路能力。因此,本週對 Mistral Large 4 最準確的描述是:一個你可以呼叫的預覽 API,以及一個你還無法擁有的模型。
那個分野本身就是故事主體,而不是故事的註腳。Mistral 在發布消息時一併公布的每一項數字——程式碼評分、資安評分、財務與法律評估——都是在一個仍在持續變動的版本上產生的,而每一個拿它與封閉式前沿模型相比的標題,所比較的都是一個不會是你實際下載到的那個產物。面對這樣一場發布,有用的做法是把今天你能驗證的東西,與要求你憑信心接受的東西區分開來,而 mistral.ai 自家的文章對於哪個屬於哪一類,難得地交代得格外大方。
10月6日實際上線的是什麼?
預覽 API 已在 Mistral Studio 上線,模型 ID 為 mistral-large-4-0。Mistral 自家的模型卡將其描述為「最先進、開放權重、通用多模態模型」,建構於細粒度 MoE 架構上,並將參數量細分為 490 億啟用參數,總參數為 1.05 兆,另加視覺編碼器。該公司在其歐洲自有資料中心內,以 3,800 顆 NVIDIA Grace Blackwell GPU 從零開始訓練;預覽版也部署在同一套基礎設施上——這是 Mistral 極力宣揚的主權主張,力度不亞於其效能宣傳。
供應商所述的規格:
• 總參數量與活躍參數量 — 總計 1.05 兆,每個 token 有 490 億活躍參數,稀疏 MoE
• 模態 — 文字與圖像輸入,文字輸出;原生多模態,而非外掛式轉接器
• 上下文視窗 — Mistral 的文件指出為 100 萬個 token;Artificial Analysis 在其測試的組態上測得 524,288,因此應將 100 萬視為供應商上限,而非實際服務的視窗
• 價格 — 每百萬輸入詞元 $1.36、每百萬輸出詞元 $4.18,快取輸入為 $0.14,依 Mistral 公布的價目表
• 上市優惠 — 同一張卡片顯示劃掉的 $0.68 / $2.09 促銷價,並附 $0.07 的快取輸入,亦即半價
• 權重 — 尚未發布;根據公告,「本月底」
• 授權條款 — 在公告與文件頁面上皆未具名,而該頁面僅將該條目標示為「Open」
其中兩行值得讀兩遍。取決於你讀的是供應商還是第三方實驗室,上下文視窗會相差兩倍;這對一個服務配置仍在變動的預覽版來說並不罕見,但在你依此估算工作負載規模之前,仍值得先知道。而你要付的價格,取決於促銷費率能否撐過上市窗口;$1.36 / $4.18 是 Mistral 自家價目表列出的數字,$0.68 / $2.09 則是它目前收取的數字。在估算帳單時,請以前者為準。

基準測試數據,以及由誰執行
Mistral 的貼文對來源出處相當謹慎,而這份謹慎值得延續。三項備受矚目的代理式編碼數字——在 DeepSWE v1.1 上達 61.7%、在 SWE-Atlas-QnA 上達 59.4%,以及在 Terminal-Bench 4.0 上達 28.3%,綜合成 49.8% 的 Coding Agent Index 分數——用 Mistral 自己的話來說,是「由 Artificial Analysis 在該測試框架公開發布之前私下評估的數字」。它們尚未出現在 Artificial Analysis 的公開指數上。當該測試框架發布時,它們就會出現。在那之前,它們是廠商發布的數字,由第三方產生但尚未發布;這比大多數發布時的宣稱具有更強的來源出處,但仍然不等同於可重現的公開分數。

今天什麼是公開且獨立的,從 Artificial Analysis 十月六日的模型頁面讀來:Mistral Large 4 Preview 得分38.4,於 Intelligence Index v4.3 上,每項任務約耗時 507 秒,Terminal-Bench 4.0 為 26.8%,長上下文推理為 81.3%。同一頁面將它列為開放權重模型,但事實上它並非開放權重——標記顯示為isOpenWeights: false,分類為「專有」,因為實際存在的,僅是由廠商自家叢集提供的預覽版。這個標記最能簡潔地說明本文所要探討的落差。

最值得引用的結果,是 Mistral 自己沒有親自跑的那一項。第三方標註公司 Surge AI 在隱藏模型身分的情況下,針對程式碼品質進行了盲測人工評估,專業標註人員在 1–5 分量表上給予 Mistral Large 4 Preview 3.74 分——五者中排名第二,領先 Kimi K3 的 3.59、GLM-5.3 的 3.60 與 GLM-5.2 的 3.40,僅次於 Claude Opus 5 的 4.22。由具名實驗室作為受測方的盲測人工評估,與自行執行的基準測試是不同類型的證據,而它是這則公告中最強的單一獨立資料點。
接著是網路安全領域,Mistral 在此提出最犀利的說法。在 Artificial Analysis 的網路指數(Cyber Index)上,該公司表示 Mistral Large 4 位列全球前五,並領先中國以外開發的開放權重模型。在一項特定測試中——重現開源軟體中的真實漏洞,然後加以修補——它拿下 82%,被形容為所有模型中最高,並在 Cybench 的 40 項競賽題目中取得 93%。Mistral 補充了一項尖銳的觀察:數個領先的閉源模型,Claude Opus 5.5與GPT-6 Astra都在點名之列,在同一項測試中得分接近零,因為它們拒絕執行該任務。在沒有第三方頁面擺在你面前的情況下,82% 只是廠商提供的數字;拒絕率論點則是廠商的解讀。兩者都看似合理,但今天都未經獨立證實。
為什麼預覽取景會改變價格計算
預覽版不只是階段標籤。這代表模型可以在比 GA 發行版更短的通知期內被重新指向、重新定價或淘汰,也代表你用來基準測試的服務配置,可能不是你部署時所面對的配置。對路由決策而言,這是實實在在的成本:一條針對本週組建調校的管線,會帶來一筆你未編列預算的重新驗證帳單。
在 OrcaRouter上,200 多個模型坐落在同一個 OpenAI 相容端點之後,以供應商的標價提供,0% 加價原封不動地直接反映,因此供應商自家價目表上的價格變動,當天就是我們這邊的價格變動——這點在這裡格外重要,因為這次發布推出兩種價格,其中一個劃上了刪除線。對一個未經實證的預覽版來說,自動容錯移轉是解答的另一半:它讓你能把一小部分正式環境流量放在 Mistral Large 4 上,同時由第一方模型承接其餘流量,因此一個在你的實際工作負載下出現退步的預覽版,會降級成一次重新路由,而不是一場事故。細心的讀者不該假設的是,Mistral Large 4 今天已經可以在 OrcaRouter 上路由。它並不在目錄中——這個預覽版是透過 Mistral 自家的 API 和幾個第三方平台存取的,而它的權重一旦推出,將是自行託管的選項。
這個 open open 目前是一個承諾
Mistral 的說法是,Mistral Large 4「將開放權重效能推向新前沿」,而開放權重是企業得以掌控模型的機制。對 Mistral 打算推出的模型來說,這是個站得住腳的論點。但對它本週實際推出的模型而言,這個機制卻不存在:沒有 Hugging Face 儲存庫、沒有授權條款文字、沒有可下載的檢查點。該公司自家的 Hugging Face 組織頁面在 10 月 6 日查看時,沒有比七月更新的內容,而其中最新的項目也與 Large 系列無關。
這不是對該計畫的批評;在紅隊演練期之後分階段釋出權重是一項連貫一致的政策,而 Mistral 對此明確表態。這是對那個形容詞的告誡。「開放權重」在一個權重還要四週才會釋出的段落裡發揮著行銷作用,而規範這些權重的授權條款尚未被指名。寬鬆授權與 Apache 式條款是其中一種結果;僅限研究或設有營收上限的授權則是另一種,而這份公告並未在兩者之間做出選擇。
十月底前要檢查什麼
有五件事會讓這份預覽成為既定事實,而且每一項都無須向 Mistral 詢問任何事就能查證:
• 一個隸屬於 Mistral 組織的 Hugging Face 儲存庫,內含檢查點與授權檔案——Mistral 承諾於本月發布的版本
• 授權條款名稱本身,決定了「開放權重」是指 Apache-2.0 式的自由,還是有使用上限的授權。
• 每 $0.68 / $2.09 的促銷費率是否維持,或回復為價目表上的 $1.36 / $4.18
• Artificial 是否會在推出時,將私下評估的程式編寫數據移到其公開指數,以及這些數據是否會維持在相同數值
• 實際提供的上下文視窗,目前由廠商列為 1M,而獨立實驗室則讀取為 524,288
在那些問題解決之前,面對 Mistral Large 4 的正確姿態,正是它自己的發布所邀請的那一種:呼叫它、在你的工作負載上衡量它,並讓正式生產路徑留在一個行為不會預定變更的模型上。權重才是重頭戲。預覽版只是預告片。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
