
Mistral Large 4 對決 GPT-6 Sol:預覽價格對上已正式推出的預設
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 143 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 293 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
紙面上,這不是一場勢均力敵的較量。Mistral 擁有 1.05 兆參數的開放權重旗艦模型 Mistral Large 4,定價為每百萬輸入詞元 0.68 美元、每百萬輸出詞元 2.09 美元。兼具成本效益的高階層級 GPT-6 Sol,定價則是 2.00 美元與 10.00 美元——輸入約為三倍,輸出將近五倍,而且一旦單次請求超過 272,000 個詞元,價格還會調整為 4.00 美元與 15.00 美元。以 4:1 的輸入/輸出比例計算,一個月用掉一億個詞元,Mistral Large 4 約花費 140 美元,GPT-6 Sol 則約 480 美元。這就是全部的論據,而它相當有力——直到你讀到 Mistral 自家文件說明的第二行:Mistral Large 4 目前處於公開預覽,而且它是這兩款模型中唯一仍在持續變動的一款。
那個區別就是整場比較的全部。GPT-6 Sol 於 2026 年 9 月 22 日推出,狀態穩定;它的行為、價目表與獨立評測分數都已底定。Mistral Large 4 則在 2026 年 10 月 6 日報到,帶著預覽版 API、一個「月底前」發布權重的承諾,以及 Mistral 表示仍在進行中的強化學習訓練。你今天呼叫的版本,不會是你十一月手上有的版本。所以真正有意思的問題不是「哪個比較好」——就測得的智慧而言,兩者還不在同一個級別——而是「哪一個該放進你的技術堆疊,又該在什麼條件下放進去」。
各家廠商實際出貨了什麼
Mistral Large 4 是一款細粒度的專家混合模型,總參數達 1.05 兆,其中 490 億為活躍參數,另配備一個 16 億參數的視覺編碼器。它能接受文字與圖像,提供約 100 萬個 token 的上下文窗口,並在 Mistral 自家的歐洲資料中心內,以 3,800 顆 NVIDIA Grace Blackwell GPU 從頭訓練。Mistral 稱其為迄今規模最大、能力最強的模型,並表示以開放授權釋出的權重將在 2026 年 10 月底前發布,但仍須先完成與網路安全合作夥伴及政府機關共同進行的紅隊測試期。在那之前,唯一的使用途徑是預覽 API。
GPT-6 Sol 是 OpenAI GPT-6 系列的中階型號,低於旗艦 GPT-6 Astra,高於主打速度的 GPT-6 Luna。它可接受文字、圖像與檔案,具備略超過一百萬個 token 的上下文視窗,最多可輸出 128,000 個 token,並提供可設定的推理強度、函式呼叫、結構化輸出與種子取樣。它是一個封閉、受審核的 API——這與 Mistral 的訴求正好相反:Mistral 主張,組織最終可以在自己的硬體上、依自己的政策運行 ML4。
• 總參數 — Mistral Large 4 1.05T(49B 活躍)vs GPT-6 Sol 未公開
• 上下文視窗 — 各約 100 萬個 token,Mistral Large 4 宣稱可達 100 萬,GPT-6 Sol 約 105 萬
• 最大輸出 — GPT-6 Sol 128K tokens 對比 Mistral Large 4 尚未有文件記載
• 輸入模態 — Mistral Large 4 文字與圖像 對比 GPT-6 Sol 文字、圖像與檔案
• 輸入價格 — Mistral Large 4 每 100 萬個 token 為 $0.68,對比 GPT-6 Sol 的 $2.00,超過 272K token 後升至 $4.00
• 輸出價格 — Mistral Large 4 每 100 萬 $2.09,相較於 GPT-6 Sol $10.00,超過相同門檻後升至 $15.00
• 快取輸入 — Mistral Large 4 每 1M 為 $0.07,對比 GPT-6 Sol 的 $0.20,並升至 $0.40
• 權重 — Mistral Large 4 採開放授權,承諾於 2026 年 10 月底前推出,對比 GPT-6 Sol 為封閉
• 發布狀態 — Mistral Large 4 公開預覽,2026 年 10 月 6 日 vs GPT-6 Sol 正式推出,2026 年 9 月 22 日

GPT-6 Sol 就是更勝一籌的地方
Mistral 的發布文章對此異常直接,這讓所有人省去了猜測。在 Artificial Analysis Intelligence Index——v4.3.2 修訂版,從 AA-Briefcase 到 CritPt 的十項評估——GPT-6 Sol 得分 47.6,在該榜單的 147 個模型中約排名第 14。Mistral Large 4 完全沒有已公布的 Index 分數。現有的只是 Artificial Analysis 上的一列部分資料,將該模型列為「Mistral Large 4 Preview」,並回報其排名為未公開。在可見的個別評估中,GPT-6 Sol 明顯領先:在 Humanity's Last Exam 上為 47.9,對照其通過的門檻,而 ML4 並未出現;在 AA-LCR 長上下文召回上為 83.7 對 80.3;在 Terminal-Bench 4.0 上為 43.9 對 28.3。
那些 Terminal-Bench 數字值得加上一個反向的但書。Mistral 的 28.3% 與 SWE-Atlas-QnA 上的 59.4%,來自 Artificial Analysis 在測試框架推出前私下評估所得的數字,而 Mistral 明確表示,等該測試框架發布後,這些數字會出現在 Artificial Analysis Coding Agent Index 上。它們不是供應商憑空捏造的,但你也無法在今天重現它們。請把它們視為前景可期但尚未驗證。
在 Mistral 確實公布數字的地方,其中有幾項值得好好解讀,因為那正是廠商有信心時會提出的說法。Mistral 報告指出,在 Artificial Analysis Cyber Index 的一項測試中——重現開源軟體中的真實漏洞,然後加以修補——ML4 得分 82%,是所有模型中最高的,並且在 Cybench 的 40 項挑戰中解出 93%。它還報告指出,包括 Claude Opus 5.5 與 GPT-6 Astra 在內的領先閉源模型,在同一項可重現性測試中得分趨近於零,因為它們拒絕執行該任務。這些都是廠商自行報告的數字,尚未經過獨立重現,但其背後的機制並不奇特:拒絕越多的模型,實際完成的就越少,而 Mistral 自其開放權重轉向以來就一直在推銷這個論點。
就一般能力而言,老實說,GPT-6 Sol 是現今較好的模型,而 Mistral Large 4 則是較便宜的那個。如果你的工作負載是單純的問答或程式編寫任務,且你不偏好自行託管,那麼 GPT-6 Sol 每百萬個輸出 token 多收的五美元,換來的是行為不會在你使用期間改變的模型。
支持預覽的理由,不僅僅是價格
有三件事讓 Mistral Large 4 不只是個折扣選項,而它們都不是標價。
第一點是字面意義上的主權。ML4 是在歐洲資料中心、以歐洲硬體訓練而成,並將可在 Mistral 端到端營運的歐洲區域內提供服務。對受監管的買家而言,這不是行銷話術;而是 GPT-6 Sol 目前無論出多少錢都無法滿足的採購要求。Mistral 在 D 輪募資中籌得 30 億歐元,正是為了資助此事,這是歐洲科技公司歷來最大一筆股權募資,而這個模型是達成此目標的第一個里程碑。
第二個是權重。當它們落地時,擁有 GPU 的組織就能在地端執行 ML4,完全不需要供應商介入,這會同時改變拒答行為與資料駐留的考量。到了那時候,GPT-6 Sol 仍然會是一次 API 呼叫。如果你的路線圖中有地端階段,ML4 是這兩者中唯一擁有地端階段的那一個。
第三點是節奏。Mistral 表示,這個預覽版背後的 RL 訓練尚未飽和,並預期「未來數週與數月將出現大幅且快速的進展」。當供應商推出預覽版並表示曲線仍在攀升時,你今天拿到的報價,對應的是你未來會被收費的模型中,最差的那個版本。GPT-6 Sol 的價格則對應到固定的能力。
兩者同時運行,但不押注於任何一方

預覽版棘手的地方在於你無法把它固定住。如果你的產品依賴 ML4 目前的行為,下週的一次更新就是一場正式環境事故。如果它依賴 GPT-6 Sol,你就是在為穩定性支付固定的溢價。合理的形態通常是兩者兼具,放在單一端點後面,因此這個決定是一條路由規則,而不是一項架構決策。
這正是 OrcaRouter 的用途。這兩個模型都置於同一個 OpenAI 相容的 API 之後,且零加成,而這一點在這裡比平常更為重要:Mistral 的預覽價格屬於上市優惠價,之後會變動——預覽期結束時會上調,而當權重釋出、開源模型市場的競爭開始發酵時則可能下調——而且由於供應商的定價會直接反映,廠商降價在我們這邊當天就生效,不必等到有人去更新硬編碼的價目表。路由 DSL 讓你能把長脈絡的文件處理工作送給對該工作型態最便宜的模型,並保留 GPT-6 Sol 作為任何必須維持穩定之任務的備援。自動容錯移轉涵蓋了預覽版 API 最常招致的情況:端點忙碌或短暫無法使用,而這對任何模型在推出的第一個月來說都是正常的。

該選哪一個
如果工作負載屬於正式生產環境,行為表現比單價更重要,而且你不需要自行執行模型,就選擇 GPT-6 Sol。它在 Intelligence Index 上的 47.6 分、128K 的輸出上限,以及 $0.20 的快取讀取費用,使其成為更穩妥的預設選擇;而 272,000 個 token 的長上下文重新計價也很容易預先規劃,因為門檻已經公開。
選擇 Mistral Large 4,如果你正在打造某個東西,而下列三件事中有任一為真:你需要一個部署在歐洲的模型、你最終需要開放權重,或者你身處安全研究領域,在那裡拒絕就是失敗——在重現並修補測試中拿到 82%,而封閉替代方案接近零,這是真實的能力差距,無論是否為廠商自行回報。並且要接受你買的是一個仍在演進中的模型。為 API 介面可能變動編列預算,且不要把預覽價格硬編碼進下一季的預測中。
無論做何決定之前,值得觀察的重點:十月底的實際權重釋出,那是「開放權重」這個宣稱不再只是承諾的時刻;ML4 首度公布的 Artificial Analysis Intelligence Index 分數,這將判定價格差距究竟是划算,還是為了較少能力而給的折扣;以及 Coding Agent Index,Mistral 未公開的 Terminal-Bench 成績會在這裡獲得印證,或者悄悄地沒有。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
