文章〈MiMo-V2.6:這篇 RL 論文說明了什麼〉的英雄標題卡,上方標語為「技術報告」,副標為「細讀小米的混合式 RL 報告,看清它驗證了什麼、又沒驗證什麼」。四枚圓角標籤分別寫著「凍結的 MoE 路由器」、「評分器成本 12.7%」、「DeepSWE 58.4 升至 72.6」與「AA Index 46」。頁腳一行寫著「DeepSWE 數據由廠商自行提報;AA Index 46 由 Artificial Analysis 實測。」OrcaRouter 標誌合成於右下角。
Guides & Insights

MiMo-V2.6:Xiaomi 的強化學習論文實際展示了什麼,以及它留下了哪些未經驗證的部分

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

本月發表的模型論文大多屬於架構論文。Xiaomi MiMo-V2.6-Pro 與 Xiaomi MiMo-V2.6-Flash 背後的技術報告則不然。其標題為 MiMo-V2.6:將強化學習擴展至自我改進,於 2026 年 9 月 21 日提交,署名為 LLM-Core Xiaomi;報告幾乎沒有篇幅花在稀疏專家混合主幹上,而幾乎所有篇幅都花在一個問題上:當整個後訓練預算都投入單一混合強化學習運行時,會發生什麼事。相較之下,DeepSeek-V4.1-Flash 的報告是一份記憶體相關文件——其篇幅用於壓縮稀疏注意力、跨層 KV 重用與 FP4 儲存。把兩者並列來看,它們是關於能力從何而來的論證,而彼此並不一致。

這份報告本身值得一讀,但值得仔細閱讀,因為它是來自執行該次實驗的實驗室的自述報告。它點出自身的機制,展示自身的消融實驗,公布自身的失敗,並在同一口氣中報告外界無法查核的數字。把這兩件事分開,就是大部分的工作。本文正是這麼做,而它寫於 2026 年 9 月 23 日——在那些檢查點上線的兩天後;此時這篇論文是關於它們最新、也最少被佐證的資料。

為什麼紙上的日期比平時更重要

小米的 MiMo-V2.6-Pro 與 MiMo-V2.6-Flash 檢查點已於 2026 年 9 月 21 日上架模型中心,採用 MIT 授權且不設任何存取門檻。該報告的日期為同一天,並在刊載它的預印本網站上登上熱門排行首位。正是這個時間點,讓這件事成為一則新聞,而非一篇回顧報導:這篇論文並不是在大家早已對該模型完成基準測試之後,才提出的後續解釋。它與模型權重同步問世,時間點早於小米以外的任何人發表獨立評測結果。

Screenshot of the MiMo-V2.6 technical report page captured September 23, 2026, showing the title 'MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement', attributed to LLM-Core Xiaomi and dated 21 September 2026, with the author list and the opening of the abstract visible.

那個排序也是這篇論文作為證據的主要弱點。它下游的一切——DeepSWE 曲線、通過率提升、獎勵破解防禦——都是關於一個只發生過一次、在單一實驗室、單一叢集內進行的訓練過程的主張,而且沒有其他人重現過。標記該報告的那串討論把這視為有趣之處:這是一篇資料與實驗論文,不是架構論文,而實驗正是那種要嘛能重現、要嘛不能的結果。

擴展的三個軸,而其中只有一個是硬體問題

該報告的論述框架是:強化學習的算力同時沿著三個軸向擴展,而第三個軸向正是改變你對這個方法之看法的關鍵。

• 批次與吞吐量 — 每次更新 1,568 個樣本,每個樣本擴展為十六次 rollout,因此每步約有 25,000 條軌跡,在上下文長度最高達一百萬個 token 的情況下,每步消耗 27 億到 37 億個 token。Rollout 架構完全非同步,這正是讓這樣的批次大小得以存續的根本原因。

• 環境 — 以單一混合式訓練涵蓋程式碼、通用代理、視覺與網路安全任務,並同時在多個代理框架下運行,而非針對各領域分別進行強化學習訓練。Xiaomi 自己對此的簡稱是「You Only RL Once」。支持混合的論點是,某一能力的進展會強化其他能力;風險則是較慢的任務類型會得不到足夠資源,而報告指出這點透過自適應排程來處理。

• 評分器算力——這個軸線在通常意義上與 GPU 無關。二元通過/失敗無法替兩個都通過的解法排名,因此獎勵訊號本身就成了你要擴展的東西。具代理性的評分器會聯合比較一項任務的十六次嘗試,並產生分級訊號,而不是一個位元。

那第三條軸線,正是標題中「自我提升」一詞之所以站得住腳的地方,也是這份報告最受檢視、最無所遁形之處。模型替自己的 rollout 評分,本身就是一個獎勵駭取的攻擊面,而這份報告也正是把它當作如此來看待。

真正值得理解的兩個機制

群組優勢重新分配

在每個步驟之後,策略會為每個任務產生十六次嘗試,並將它們全部放入共用工作區,讓評估模型能一起審視它們,而不是一次審視一個。接著,通過的修補程式會依五個面向評分:方法是否符合問題、實作是否精確且沒有不必要的後備方案、變更是否最小、是否編輯了任何超出範圍的內容,以及是否符合周遭的程式碼風格。排名較低的通過者會獲得較少的正向強化。經確認屬於取巧的修補程式會被歸零,並視為失敗。

其結果是形成一種訓練訊號,傾向於產出更短、更省成本的解法,而不只是正確的解法——報告將此描述為朝「每項任務使用更少 token」的方向引導。這一點值得牢牢記住,因為論文後段的主要結果卻指向相反的方向。

分組獎勵合成

同一構想的離線那一半。團隊並非單純從即時評分器推導品質,而是預先計算特定任務的評分準則,並將二元測試獎勵乘以取自這些準則的品質與行為分數。報告將此描述為從對比式推演建立評分準則——也就是從結果不同的案例中建立,因為資訊就在那些地方。

評分並非免費。報告將評分者成本列為約占 MiMo-V2.6-Pro 總強化學習成本的 12.7%。對任何考慮複製這套方法的人來說,那個單一數字是這篇論文裡最有用的資訊,因為它把「擴大評分者規模」從一個想法變成一個預算項目。

凍結路由器是大多數團隊會最先複製的結果

報告的穩定性章節中有一項發現本身即能成立,與 MiMo-V2.6 無關,也與該模型表現得好不好無關。

透過可訓練的專家混合路由器,專家負載在二十步內嚴重漂移。各專家之間的變異係數從 0.78 升至 2.0。最繁忙專家的尖峰負載從平均值的六倍變成十六倍。冷門專家——也就是幾乎沒有收到任何流量的專家——佔比從 0.5% 升至 22%。在第 20 步將路由器權重還原為初始值後,平衡立刻恢復。

小米的回應是在整輪訓練中凍結 MoE 路由器。其理由並不隱晦:在這樣的批次規模下,路由不穩定是一種你大可直接選擇不要的訓練動態問題,而路由器並不是強化學習發揮其作用的地方。凍結是否會在最終品質上造成任何代價,已發表的資料中並沒有消融實驗來回答,而這是個合理想知道的問題。

這項發現沒有提及的,是任何與服務(serving)有關的事。訓練執行期間的路由器負載平衡,與生產流量下的專家使用率,是兩個不同的問題,而這份報告只處理了前者。

數字,附帶著它們的標籤

這份報告的主要結果在輪廓上乾淨俐落,在細節上卻雜亂無章;而這種雜亂並不是醜聞——它是對三個同名但不同的對象所作的三種不同測量。

• DeepSWE v1.1(留出集)——MiMo-V2.6-Pro 在整段執行中從 58.4 升至 72.6;MiMo-V2.6-Flash 則從 48.7 升至 65.7。該基準包含 113 項長時程儲存庫工程任務,由五種程式語言的功能驗證器評判,而指標是 average@3——三次取樣嘗試的平均驗證器通過率,這與三次嘗試中是否有任何一次成功並不相同。把 avg@3 解讀為 pass@3,會高估頁面上的每一個數字。

• 同一個基準,在別處測得的結果——已發布的模型卡上,Pro 印出 71.9,Flash 印出 67.9。小米的公開訓練儀表板則印出 72.57 與 65.68。因此每個模型各有三個已公布的數字,其中兩個來自小米,而這對同系列型號的差異方向各不相同。它們沒有哪一個是錯的;它們分別描述的是儀表板快照、模型卡條目與報告中的一行,處於不同時間點,且可能使用不同的測試框架。

• 蒸餾 — MiMo-V2.6-Distill-Qwen-9B,以 MiMo 生成的示範資料對 Qwen3.5-9B 進行微調,將 SWE-bench Verified 從 61.1 提升到 66.2。這是論文中可轉移性最高的數字,因為 9B 的學生模型是大多數團隊實際上能負擔執行的規模。

• 一項內部的資安迷你基準測試 —— 31.3 至 47.0。內部就是內部:這些任務並未公開,因此這個差距即使在原則上也無法重現。

• Artificial Analysis 智慧指數 —— MiMo-V2.6-Pro 拿下 46 分。這個數字的性質與眾不同。它是由 Artificial Analysis 以自家評測框架對已釋出的檢查點(checkpoint)實測得出,而非由小米提供,這使得它成為本次發布中唯一一個讀者可以視為「實測」而非「轉述」的頭條數字。它同時也是用來與 GLM-5.3、Kimi K3 以及封閉陣營前沿模型相比較的數字,且比 Claude Opus 5 低了五分。

A scoreboard card titled 'Published by Xiaomi vs verified from outside', subtitled 'Every headline figure in the report, and who stands behind it', with columns 'Dimension', 'In the report' and 'Independent status'. Rows read: DeepSWE v1.1, held out — 58.4 to 72.6 Pro; 48.7 to 65.7 Flash, average@3 — No third-party rerun; Released model card — 71.9 Pro; 67.9 Flash — Vendor-published; Public training dashboard — 72.57 Pro; 65.68 Flash — Vendor-published; Distill-Qwen-9B — SWE-bench Verified 61.1 to 66.2 — No third-party rerun; Internal cyber benchmark — 31.3 to 47.0 — Tasks not published; AA Intelligence Index — 46 for MiMo-V2.6-Pro — Measured by Artificial Analysis. A footer reads 'DeepSWE, card and dashboard figures are vendor-reported and have not been independently reproduced; the internal benchmark tasks are not published. The AA Intelligence Index is the one headline number produced outside Xiaomi.' The OrcaRouter logo is composited in the bottom-right corner.Screenshot of the Artificial Analysis model page for MiMo-V2.6-Pro captured September 23, 2026, showing an Intelligence Index of 46, an Intelligence versus Cost scatter placing MiMo-V2.6-Pro against Kimi K3, Claude Opus 5 and other frontier models, and a comparison table of the same models.

這份報告對自身表格的侷限相當誠實,而這句話值得拿去回敬任何不誠實的人:這些比較混雜了公開與內部基準,並未將強化學習的貢獻與架構或預訓練區隔開來。一個模型在經過強化學習後表現更好,並不證明強化學習就是原因。

還有第二個但書,而這正是與該論述框架相牴觸的一點。報告中的增益通常伴隨著 token 使用量上升。報告將其呈現為能力的持續提升,而非效率提升,而這麼做是對的。但 GAR 的明確設計目標是引導模型走向更短路徑,並降低每項任務的 token 用量,而整體結果並未顯示工作負載變得更便宜。能力提升了;每項任務的成本並未下降。如果你把「自我改進」理解為「模型下一季會需要我少花一點錢」,這篇論文並不支持這種解讀。

報告未經核實的內容

截至 2026 年 9 月 23 日,尚無任何第三方發表 DeepSWE、Terminal Bench 或 CyberGym 欄位的獨立重跑結果。真正關鍵的區別在於索引點與其他一切之間:46 是別人實際做出的測量值,而 72.6 則是針對一次無人能重新執行的訓練運行所提出的說法,因為據報導該次訓練運行 Pro 耗費了 260 萬美元、Flash 耗費了 90 萬美元,而且不會再發生第二次。

Xiaomi 確實公開了大多數實驗室不會公開的東西:訓練動態、強化學習框架與任務環境——涵蓋軟體工程、漏洞重現、知識工作與網頁設計的 7,000 多個分級環境。那才是保存期限最長的產物。權重告訴你這輪訓練產出了什麼;環境則告訴你如何自己執行這個實驗,而這是任何強化學習主張最終得以定論的唯一途徑。

針對獎勵駭取的防禦值得特別附加一項但書。它被描述為多層次——獎勵設計、對抗式評估、異常偵測,以及驗證器之間的交叉核對——而且這套描述完全出自一旦它失效就會顏面盡失的那一方。針對模型操弄以模型為基礎的評分器所設的防禦,並非自我報告所能結案的那種事。該機制被點名,失效模式也獲得承認,這比大多數論文做得更多,但它仍是個未解的問題。

你今天實際上能用這個做什麼

兩個檢查點皆可下載、無需權限控管,並採用 MIT 授權標籤:Xiaomi MiMo-V2.6-Pro-RL 與 Xiaomi MiMo-V2.6-Flash-RL,皆為全模態、具備 100 萬 token 上下文;其中 Flash 索引回報了 172.9 GB 的權重資料,分散於 65 個分片,格式為 FP8。小米尚未公布 V2.6 世代的每 token 費率表,因此如今的選擇,是在自行託管與你已付費使用的代管模型之間做取捨。

那個比較,正是這篇論文實用價值落腳之處,而它對這篇論文的評價並不好看——但這種不好看是有用的。受到檢驗的主張並不是「MiMo-V2.6-Pro 好不好」——那 46 個答案已經回答了這件事。而是「在混合式代理任務上做強化學習,所產生的推理能力究竟能不能遷移到我的工作負載上」,而要誠實回答這一點,唯一的方法就是兩者都跑、然後比較,而這在成為研究問題之前,先是個路由問題。DeepSeek-V4.1-Flash 只差一把 API 金鑰,每百萬 token 要價 0.15 與 0.60 美元,Qwen3.8-Flash 與 GLM-5.3-Flash 則共用同一把金鑰,而如果你想把自己託管的 MiMo 檢查點放到同一個端點後面跑上一週,看看 DeepSWE 曲線會不會出現在你自己的評估裡,那只是一次設定變更,而不是一次搬遷。OrcaRouter 並不代管小米的模型,這裡的任何內容也不該被解讀為如此宣稱——但你會拿來與它們對標的那些模型,全都可以透過一把 OrcaRouter API 金鑰,以供應商牌價、0% 加價原樣轉嫁取得,而且如果你正在試用的檢查點在高負載下顯得不穩定,還會自動容錯移轉。

未經實證的模型案例,正是容錯移轉機制存在的目的。兩天前發布的檢查點,附有廠商自行執行的評估,且沒有獨立重跑,正是你會想拿來試用、而不讓正式環境路徑依賴它的那種東西。

誰應該閱讀這篇論文?

如果你在做後訓練,請為了路由器那個發現和評分器成本數字去讀它。這兩者都可移植、測試起來都便宜,而且都不需要你相信任何關於 MiMo-V2.6 基準表的說法。尤其是凍結路由器的結果,這種東西花一個下午就能試,卻能省下整整一次訓練。

如果你正在挑選模型,讀那個指標分數就好,其餘的可以略過。Artificial Analysis 在發布的成品上測得 46;這是本次發布中唯一不是來自廠商的數字,而它讓 MiMo-V2.6-Pro 登上開放權重領域的頂端,並落後 Claude Opus 5 五分。報告中其餘內容都在描述小米如何走到這一步,而小米走到這一步的方式,並不是你花錢就買得到的。

而如果你讀的是報導,而不是論文,要注意的關鍵詞是「自我改進」。這份報告自身的結果顯示,能力會隨著 token 使用量一同提升,這是關於擴展強化學習的一項真實且可重現的發現。它並不是在聲稱模型跑起來變得更便宜;而接續這篇之後的論文,才會告訴你它最終是否會變得如此。