
MiMo-V2.6-Pro 以每項任務 0.13 美元,將開放權重推上帕雷托前沿
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
小米 MiMo-V2.6-Pro 於 2026 年 9 月 21 日在 Hugging Face 上架,而自此之後傳得最遠的數字是 46——那是它在 Artificial Analysis Intelligence Index v4.3.2 上的得分,也是歷來任何開放權重模型在該綜合指標上寫下的最高分。決定你實際上能不能跑得動它的那個數字則更小。Artificial Analysis 在自家測試框架上評估 MiMo-V2.6-Pro 時,測得每個 Intelligence Index 任務的運算成本為 0.1332 美元,而這個數字讓該模型落在該網站「智能對比每任務成本」圖表的帕雷托線上。在四捨五入的下限之上,它是那條線上唯一的開放權重模型。
那是一個比「頂尖開放權重模型」更狹隘、也更有用的說法,而後者是多數發表報導所採用的框架。在智慧軸上位居第一,告訴你的是上限。落在成本曲線上,則告訴你市場上是否有其他東西在那個價格下嚴格更好。就 Xiaomi MiMo-V2.6-Pro 而言,截至本文撰寫時,沒有。
帕雷托線實際上衡量的是什麼
這張圖表將 Artificial Analysis 評估過的每一個模型繪製在兩條軸上:一條軸是 Intelligence Index,另一條軸是完成一項 index 任務的加權平均美元成本。位於 Pareto 線上的模型,無法被任何單一其他模型在兩條軸上同時超越——你找不到更聰明又更便宜的選擇。位於該線下方與左側的點則受到支配,因而掉出線外。
我們根據圖表中內嵌的資料重新計算了前沿,而不是憑肉眼判讀那條線。我們以 326 個同時具有指標分數與每項任務實測成本的模型為基礎,目前的前沿共有十四個點:
• Qwen3.5 2B(非推理)— 指數 6.2,每項任務成本四捨五入為 $0.000,開放權重
• Devstral 2 — 指數 8.6,每項任務成本四捨五入為 $0.000,開放權重
• North Mini Code — 指數 9.9,每項任務成本四捨五入為 $0.000,開放權重
• Claude Sonnet 4.6(非推理,高努力)— 指數 24.7,每項任務成本四捨五入為 $0.000,封閉
• Grok Build 0.1 0616 — 指數 27.2,每項任務成本 $0.006,封閉
• GPT-5.6 Luna(高)— 指數 32.1,每項任務成本 $0.044,封閉
• GPT-5.6 Luna(極高)— 指數 34.6,每項任務成本 $0.085,封閉
• Xiaomi MiMo-V2.6-Pro — 指數 46.3,每項任務成本 $0.133,MIT 授權的開放權重
• GPT-6 Astra(中)— 指數 49.6,每項任務成本 $1.541,封閉
• GPT-6 Astra(高)— 指數 50.9,每項任務成本 $1.725,封閉
• GPT-6 Astra(極高)— 指數 52.4,每項任務成本 $2.309,封閉
• GPT-6 Astra(最高)— 指數 52.7,每項任務成本 $3.258,封閉
• Claude Fable 5.1(極高,預設備援)— 指數 53.2,每項任務成本 $5.978,封閉
• Claude Fable 5.1(最高,預設備援)— 指數 53.4,每項任務成本 $7.630,封閉
從那份清單可以歸納出三件事。最便宜的四個點是實測成本四捨五入到小數點後四位為零的模型,因此曲線中有意思的部分是從 Grok Build 0.1 0616 開始的。Xiaomi MiMo-V2.6-Pro 是曲線上貨真價實的膝點,不是四捨五入造成的假象:再往上一個點,每項任務的成本高出 11.6 倍,只多換來 3.3 點指數分數。而在十個成本非零的前沿點中,恰好只有一個是開放權重——這正是「頂尖開放權重模型」這種說法所掩蓋的事實。在智能軸上最接近的開放權重模型 GLM-5.3 (max) 為 44.8,卻離那條線還差得遠:它每項指數任務要價 $2.006,是 MiMo-V2.6-Pro 數值的十五倍。Kimi K3 (max) 則落在 43.6 與每項任務 $2.000。

價目表沒有變動。帳單卻變了。
小米這一代並未調漲價格。MiMo-V2.6-Pro 的定價為每百萬輸入 token 0.435 美元、每百萬輸出 0.87 美元,而快取命中的輸入價格為 0.0036 美元——折扣幅度達 99.17%——這與前代旗艦所採用的價目表相同。以 7:2:1 的快取命中/輸入/輸出混合比例計算,這相當於每百萬 token 0.1765 美元。
然而,以 Intelligence Index 對 MiMo-V2.6-Pro 進行測試的成本為 206.66 美元,即每項任務 0.1332 美元,而同一套指標對 MiMo-V2.5-Pro 的測試成本則是每項任務 0.054 美元。Artificial Analysis 在相同的測試套件上記錄到,較新模型產生了 1.4 億個輸出 token,而較舊模型為 1.1 億個。價目表並未改變;模型只是為了回答同一個問題而寫得更多。這是對帕雷托最適位置所做的誠實補充說明——小米 MiMo-V2.6-Pro 儘管變得更為冗長,仍在成本軸上贏得了一席之地,而非因為它變得更便宜。
對任何正在估算預算的人來說,實務上的解讀是:以 token 為單位的定價如今已是很弱的指標,難以預測工作負載要花多少成本。兩個使用相同價目表的模型,在每完成一項任務的成本上可能相差 2.5 倍。快取折扣是能撬動幅度最大的槓桿:以每百萬個快取輸入 token 為 $0.0036 來看,重用上下文的提示與不重用上下文的提示之間的差異,大於這份清單上大多數模型配對之間的差異。
此分數涵蓋與不涵蓋的內容
46 是第三方測量結果,這點很重要,因為關於 MiMo-V2.6-Pro 幾乎所有其他已發布的數據都不是。索引版本也很重要:v4.3.2 是涵蓋推理、知識、數學與程式設計的十項評估的綜合體,而分數只有在同一版本上才能與其他分數相比較。小米在發布時一併公布的廠商數據——DeepSWE v1.1 為 71.9、AutomationBench v1.0.6 為 53.1、Toolathlon-Verified 為 76.9、Terminal Bench 2.1 為 89.9、CyberGym 為 94.0——來自小米自家的測試框架與評分器,且尚未被任何人重現。它們可作為該模型針對什麼進行調校的方向性證據,但並非排行榜上的成績。
這次發布的另一半是開放權重套件。Artificial Analysis 將該模型列為 1.0T 總參數、42B 啟用參數、1M token 上下文視窗,支援文字、圖像、語音與影片輸入並輸出文字,且採用 MIT 授權,權重放在 Hugging Face。該儲存庫本身回報的 Safetensors 模型大小為 524B 參數——這是第三個數字,既不符合 1.0T 總參數,也不符合 42B 啟用參數數,而小米尚未對此作出釐清。如果你打算自行託管部署,在配置任何資源之前,值得先解決這個落差,因為 524B FP8 檢查點和 1T 檢查點所需的硬體規模完全是兩回事。

一個你目前無法前往的邊境點
可用性狀況是本次發布最受限的一環。Artificial Analysis 在評估 Xiaomi MiMo-V2.6-Pro 時,只計入了一家提供該模型 API 的供應商。Hugging Face 的儲存庫指出,Xiaomi MiMo-V2.6-Pro 並未由任何推論服務供應商部署。我們本身也未託管它,而且我們不會暗示其他情況——如今取得這個模型的途徑,就是小米自家的平台,以及收錄它的第三方目錄。
那是容錯移轉問題,而不是品質問題,而這正是路由器存在的目的:解決這個特定問題。 用一個 API 存取數百個模型,並在供應商之間自動容錯移轉,這能把「目前只有一家供應商列出這個模型」從架構風險變成設定細節。這也是你分階段移轉到這麼新模型上的做法:把一部分流量送往 Xiaomi MiMo-V2.6-Pro,在它背後保留一個經過驗證的模型,讓路由器移動請求,而不是靠你的待命輪值。這對我們有提供的模型有效。至於這一個,在它可以被路由之前,誠實的建議是別把它放上關鍵路徑。
什麼會讓它離開這條線?
帕雷托位置是一個快照,而不是模型的固有屬性。有三件事會改變它。小米降價會讓 Xiaomi MiMo-V2.6-Pro 進一步向左移,使它更難被超越——而且因為我們以 0% 加價將供應商定價原樣轉嫁,這樣的降價只要在任何地方出現,我們這邊當天就會同步生效。一款定價更低、得分高於 46.3 的模型會直接把它擠下榜;GPT-6 Astra(low)目前已以每項任務 0.818 美元的價格落在 45.8,雖然更貴,但在智力軸上近得令人不安。而 MiMo-V2.6-Flash 的獨立基準測試——它目前根本沒有 Artificial Analysis 頁面——可能會揭示,這款更便宜的兄弟模型在大多數工作負載下佔據曲線上更好的位置。
目前,站得住腳的說法是算術上的那個。在當前的索引版本上,以當前公布的價格來看,市場上沒有任何模型既在每項任務上更便宜,又比小米 MiMo-V2.6-Pro 更聰明。這個說法能否撐過首次獨立複現,才是值得關注的問題。

