
小米 MiMo-V2.6-Pro 以 46 分登上 Open-Weights Index 榜首,並公開訓練帳單
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro 現在是 Artificial Analysis Intelligence Index 上排名最高的開放權重模型,在 v4.3.2 上得分為 46——領先 GLM-5.3 一分、領先 Kimi K3 兩分,並比其前代 MiMo-V2.5-Pro 在較早指數尺度上錄得的 26 分高出二十分。那個數字是由 Artificial Analysis 以自家測試框架跑出來的,而不是由 Xiaomi 產生,這是本次發布中最有用的一項事實。第二有用的事實是它旁邊印出的價格:每百萬輸入 token 0.43 美元、每百萬輸出 0.87 美元,而 Claude Opus 5 則是 5.00 美元與 25.00 美元——這款模型在指數上還高出五分。第三項則是沒有人預料 Xiaomi 會交出的東西:公開交代產出 MiMo-V2.6-Pro 的強化學習訓練運行實際花了多少成本。
分數是一種測量,而不是一項主張。
幾乎所有關於中國模型發布的公開報導,都以廠商數字的形式出現,讀者也早已學會對這些數字打折扣。這次不一樣,而這個差異值得精確說明,因為發布報導已經把它模糊掉了。
Artificial Analysis 對 MiMo-V2.6-Pro 本身進行了評估,採用 v4.3.2 綜合評測——涵蓋推理、知識、數學與程式設計的十項評估,包括 AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience 與 AA-LCR v1.1。這個 46 分就是該套評估回傳的結果。它還記錄了決定一個模型是可用而不只是優秀的運作特性:每秒 134.3 個輸出符元、首個符元耗時 2.15 秒、99% 快取折扣,以及每項 Intelligence Index 任務的實測成本為 0.13 美元。
其中有兩點值得強調。每秒 134.3 個 token 讓 MiMo-V2.6-Pro 在速度上位居 114 個模型中的第 11 名——對一個兆參數的專家混合模型而言,這是推論服務的成果,而不只是訓練成果。而每項任務 0.13 美元則是禁得起預算考驗的數字:這是該指標實際針對此模型執行時的成本,並以相同方式在排行榜上每個模型上量測,因此讓它具備一種頭條每 token 費率所沒有的可比性。

這個指數涵蓋什麼、不涵蓋什麼
開放權重的王冠是真的,但比表面上看起來更窄。MiMo-V2.6-Pro 以 46 分領先開放權重類別,卻沒有領先這份指數。v4.3 的榜首是以最高力度運行、搭配預設備援的 Claude Fable 5.1,以及以最大力度運行的 GPT-6 Astra,兩者同為 53 分;Claude Opus 5 為 51 分,Claude Fable 5 為 50 分。因此,誠實的說法是:在一個獎勵廣度的綜合指標上,與前沿相差五點,而相較小米自家前一代則進步了二十點。
• 開放權重領先者 — Xiaomi MiMo-V2.6-Pro 46、GLM-5.3(max)45、Kimi K3(max)44
• 同一指數的榜首 — Claude Fable 5.1(max,備援)53、GPT-6 Astra(max)53、Claude Opus 5(max)51
• 速度 — 每秒輸出 134.3 個詞元,在 114 個受測模型中排名第 11;同尺寸級距的中位數為 77.9
• 首個 token 的時間——2.15 秒,相較於中位數 2.34 秒
• 每個 Intelligence Index 任務的成本 — $0.13,而整個評估的執行成本為 $206.66
• 標價 — 每百萬輸入 token 為 $0.43,每百萬輸出為 $0.87,快取折扣 99%,而在 7:2:1 的快取命中/輸入/輸出混合比例下,混合價格為 $0.18
Artificial Analysis 頁面上有一個數字是真正的警訊,而非自誇:在撰寫本文時,它只計入了 MiMo-V2.6-Pro 的一家 API 供應商。這是這款模型目前實際上的瓶頸,而這不是品質問題——而是可用性問題。只能透過單一路徑觸及的模型沒有容錯移轉機制。若該路徑效能下降,你的應用程式也會連帶受影響,而容錯移轉正是路由器存在所要提供的。對任何要圍繞這次發布做規劃的人來說,相關的觀察重點是:我們並未託管 MiMo-V2.6-Pro,也不會佯裝並非如此;目前通往它的途徑,就是 Xiaomi 自家的平台,以及少數有將它收錄進目錄的第三方服務。

兩個不得混用的數字
小米也公布了自己的基準測試數據,而這些數據與 46 是不同的東西。該公司的儀表板顯示,MiMo-V2.6-Pro 在強化學習訓練過程中,於 DeepSWE v1.1 上從 58.4 提升到 72.57,並以 mini-swe-agent 取三次平均進行評估。那是小米自家的測試框架、小米自家的評分器、小米自家的離線執行。它尚未提交到公開的 DeepSWE 排行榜,也沒有任何人重現過。
把兩者並排閱讀,很容易就會把 72.57 當成與公開 DeepSWE 排行榜列於最高層級的 74% 同等級的分數。它們並不在同一個尺度上。排行榜上的數字是一份提交的配置,Pass@1,附有已公布的信心區間與每項任務的平均成本;而廠商提出的數字則是內部評估,這些東西一概皆無。我們自己 9 月 21 日的文章在這些數字還只是儀表板讀數時就已提出這一點,而如今權重已經釋出,這點依然成立。廠商自家的評測框架可以完全誠實,卻仍然不構成排行榜上的登錄項目,因為排行榜登錄項目是一項關於特定條件下特定配置、可由第三方重新執行驗證的主張。
同樣的嚴謹態度也適用於訓練支出。小米回報 Pro 與 Flash 訓練運行合計約 3,474,715 美元——Pro 為 2,620,670 美元,Flash 為 854,044 美元——各自經過三十多個強化學習步驟,且各約有 750,000 條軌跡,在不到六天內完成。這些是該公司自家的運算資源核算數字。它們之所以有意思,是因為實驗室幾乎從不公布這些數字,而且它們不是 API 價格,不是你會支付的成本,也不是任何第三方審計過的數字。
Xiaomi 實際上出貨了什麼
此次發布的是一款稀疏混合專家模型,總參數達 1.02 兆,每個 token 啟用 420 億個參數,具備 100 萬 token 的上下文視窗,並原生支援文字、圖像、影片與音訊的多模態能力。其同系列的小米 MiMo-V2.6-Flash 採用相同架構但規模較小,總參數為 3,090 億,啟用參數為 150 億。已發布的權重帶有 MIT 授權標籤,發布套件包含技術報告、部署說明,以及——根據小米的說法——用於檢視與重現後訓練階段所需的強化學習訓練環境與程式碼。
最後那一項,正是這次發布與典型 API 發表之間實質上的差異,值得把它與行銷宣傳區分開來。公開 RL 環境,等於宣稱這套訓練設定是可受檢驗的。已公開的環境是否足以重現 72.57,則是另一個問題,將由實際嘗試重現的人來定論,而不是由發布說明來決定。小米自家的訓練紀錄描述了一次執行,在單一回合中混合了程式編寫、通用代理、視覺與資安任務,並搭配會對成功軌跡進行排名、把獎勵重新分配給較佳路徑的評分器——而這些紀錄也記載了失敗:因專家負載不均所導致的 GPU 記憶體不足重啟、訓練叢集與評分器部署之間的網路故障,以及一起基礎設施錯誤約有三小時未被偵測到之後發生的 Flash 重啟。把缺失與成果一併公開,正是讓其餘揭露內容具備可信度的關鍵。
通話要花多少錢,以及路由問題落在何處
以每百萬個 token 0.43 美元與 0.87 美元的價格來看,MiMo-V2.6-Pro 的定價像中階模型,基準測試表現卻像前沿開放權重模型。小米沿用了前一代 MiMo-V2.5 的標準定價,而非把新的 checkpoint 向上調價,這就是為什麼相對於參數數量,這個費率看起來偏低。99% 的快取折扣意味著快取密集的 agent 迴圈讀取其脈絡幾乎不花任何成本,而這正是長時程 agent 帳單真正累積的地方。
這筆交易有一種能乾淨路由的版本,也有一種不能的版本。能的那個版本是:你會拿來與 MiMo-V2.6-Pro 比較的那些前沿模型——定價 $5.00/$25.00 的 Claude Opus 5、GPT-6 Astra、Gemini 3.8 Flash、GLM-5.3——全都能透過一組 OrcaRouter 金鑰,以供應商定價、0% 加價取得,因此其中任何一家廠商降價,我們這邊當天就同步生效,而路由規則可以在第一個模型回應緩慢或無法使用時,把請求送往第二個模型。這一點在這裡比平常更重要,因為開放權重分數最高的模型,同時也是通往它的路徑最單薄的那一個。把兩者組合起來——一條便宜開放權重通道負責大量工作,一條前沿通道負責困難的長尾——是一個路由決策,而這種決策一旦兩條通道都掛在同一組金鑰上,就不再是一場賭注了。
還有一項產品也得弄清楚,因為它很容易和模型本身混為一談:小米同時還推出 MiMo-V2.6-Pro-UltraSpeed,這是建構自同一份檢查點的託管服務層級。小米自家的資料宣稱,在相同品質下,輸出速度最高可達標準 Pro 服務的二十倍;第三方型錄列出的說法則是大約十倍。這是描述同一個層級的兩個不同數字,沒有人公布過能讓兩者相符的逐次請求延遲分布,而且這個層級的費率明顯較高。UltraSpeed 本身並未改變權重能做到什麼——它改變的是別人的伺服器執行這些權重的速度。
什麼會改變這幅景象?
三件事,按它們的重要性排序。
第二與第三條服務路由。Artificial Analysis 上的單一供應商計數,是其他一切的限制因素。更多路由意味著容錯移轉,意味著服務層的價格競爭,也意味著模型可以放進正式生產路徑,而不只是實驗。
DeepSWE 數據的獨立重現。46 這個數字已經獨立驗證;72.57 則不然。若外部跑分落在它附近,這款模型的立論就會大幅增強。若外部結果明顯低於它,那麼該信任的仍是 Artificial Analysis 的數字,而廠商提供的數字則會加入那一長串一接觸現實便不攻自破的發布宣稱之列。

逐項評估的細分結果。綜合分數終究只是綜合分數。MiMo-V2.6-Pro 在十項評估中哪些勝出、哪些落敗,正是決定它是你用於代理式程式編寫的模型,還是用於檢索密集型問答的模型之間的差別,而單看指數並不會告訴你這件事。那個細節正是接下來該留意的重點,也是路由配置在值得寫下來之前所需要的東西。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
