
MiMo-V2.6:Xiaomi 的強化學習論文實際展示了什麼,以及它留下了哪些未經驗證的部分
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 36 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 182 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
本月發表的模型論文大多屬於架構論文。Xiaomi MiMo-V2.6-Pro 與 Xiaomi MiMo-V2.6-Flash 背後的技術報告則不然。其標題為 MiMo-V2.6:將強化學習擴展至自我改進,於 2026 年 9 月 21 日提交,署名為 LLM-Core Xiaomi;報告幾乎沒有篇幅花在稀疏專家混合主幹上,而幾乎所有篇幅都花在一個問題上:當整個後訓練預算都投入單一混合強化學習運行時,會發生什麼事。相較之下,DeepSeek-V4.1-Flash 的報告是一份記憶體相關文件——其篇幅用於壓縮稀疏注意力、跨層 KV 重用與 FP4 儲存。把兩者並列來看,它們是關於能力從何而來的論證,而彼此並不一致。
這份報告本身值得一讀,但值得仔細閱讀,因為它是來自執行該次實驗的實驗室的自述報告。它點出自身的機制,展示自身的消融實驗,公布自身的失敗,並在同一口氣中報告外界無法查核的數字。把這兩件事分開,就是大部分的工作。本文正是這麼做,而它寫於 2026 年 9 月 23 日——在那些檢查點上線的兩天後;此時這篇論文是關於它們最新、也最少被佐證的資料。
為什麼紙上的日期比平時更重要
小米的 MiMo-V2.6-Pro 與 MiMo-V2.6-Flash 檢查點已於 2026 年 9 月 21 日上架模型中心,採用 MIT 授權且不設任何存取門檻。該報告的日期為同一天,並在刊載它的預印本網站上登上熱門排行首位。正是這個時間點,讓這件事成為一則新聞,而非一篇回顧報導:這篇論文並不是在大家早已對該模型完成基準測試之後,才提出的後續解釋。它與模型權重同步問世,時間點早於小米以外的任何人發表獨立評測結果。

那個排序也是這篇論文作為證據的主要弱點。它下游的一切——DeepSWE 曲線、通過率提升、獎勵破解防禦——都是關於一個只發生過一次、在單一實驗室、單一叢集內進行的訓練過程的主張,而且沒有其他人重現過。標記該報告的那串討論把這視為有趣之處:這是一篇資料與實驗論文,不是架構論文,而實驗正是那種要嘛能重現、要嘛不能的結果。
擴展的三個軸,而其中只有一個是硬體問題
該報告的論述框架是:強化學習的算力同時沿著三個軸向擴展,而第三個軸向正是改變你對這個方法之看法的關鍵。
• 批次與吞吐量 — 每次更新 1,568 個樣本,每個樣本擴展為十六次 rollout,因此每步約有 25,000 條軌跡,在上下文長度最高達一百萬個 token 的情況下,每步消耗 27 億到 37 億個 token。Rollout 架構完全非同步,這正是讓這樣的批次大小得以存續的根本原因。
• 環境 — 以單一混合式訓練涵蓋程式碼、通用代理、視覺與網路安全任務,並同時在多個代理框架下運行,而非針對各領域分別進行強化學習訓練。Xiaomi 自己對此的簡稱是「You Only RL Once」。支持混合的論點是,某一能力的進展會強化其他能力;風險則是較慢的任務類型會得不到足夠資源,而報告指出這點透過自適應排程來處理。
• 評分器算力——這個軸線在通常意義上與 GPU 無關。二元通過/失敗無法替兩個都通過的解法排名,因此獎勵訊號本身就成了你要擴展的東西。具代理性的評分器會聯合比較一項任務的十六次嘗試,並產生分級訊號,而不是一個位元。
那第三條軸線,正是標題中「自我提升」一詞之所以站得住腳的地方,也是這份報告最受檢視、最無所遁形之處。模型替自己的 rollout 評分,本身就是一個獎勵駭取的攻擊面,而這份報告也正是把它當作如此來看待。
真正值得理解的兩個機制
群組優勢重新分配
在每個步驟之後,策略會為每個任務產生十六次嘗試,並將它們全部放入共用工作區,讓評估模型能一起審視它們,而不是一次審視一個。接著,通過的修補程式會依五個面向評分:方法是否符合問題、實作是否精確且沒有不必要的後備方案、變更是否最小、是否編輯了任何超出範圍的內容,以及是否符合周遭的程式碼風格。排名較低的通過者會獲得較少的正向強化。經確認屬於取巧的修補程式會被歸零,並視為失敗。
其結果是形成一種訓練訊號,傾向於產出更短、更省成本的解法,而不只是正確的解法——報告將此描述為朝「每項任務使用更少 token」的方向引導。這一點值得牢牢記住,因為論文後段的主要結果卻指向相反的方向。
分組獎勵合成
同一構想的離線那一半。團隊並非單純從即時評分器推導品質,而是預先計算特定任務的評分準則,並將二元測試獎勵乘以取自這些準則的品質與行為分數。報告將此描述為從對比式推演建立評分準則——也就是從結果不同的案例中建立,因為資訊就在那些地方。
評分並非免費。報告將評分者成本列為約占 MiMo-V2.6-Pro 總強化學習成本的 12.7%。對任何考慮複製這套方法的人來說,那個單一數字是這篇論文裡最有用的資訊,因為它把「擴大評分者規模」從一個想法變成一個預算項目。
凍結路由器是大多數團隊會最先複製的結果
報告的穩定性章節中有一項發現本身即能成立,與 MiMo-V2.6 無關,也與該模型表現得好不好無關。
透過可訓練的專家混合路由器,專家負載在二十步內嚴重漂移。各專家之間的變異係數從 0.78 升至 2.0。最繁忙專家的尖峰負載從平均值的六倍變成十六倍。冷門專家——也就是幾乎沒有收到任何流量的專家——佔比從 0.5% 升至 22%。在第 20 步將路由器權重還原為初始值後,平衡立刻恢復。
小米的回應是在整輪訓練中凍結 MoE 路由器。其理由並不隱晦:在這樣的批次規模下,路由不穩定是一種你大可直接選擇不要的訓練動態問題,而路由器並不是強化學習發揮其作用的地方。凍結是否會在最終品質上造成任何代價,已發表的資料中並沒有消融實驗來回答,而這是個合理想知道的問題。
這項發現沒有提及的,是任何與服務(serving)有關的事。訓練執行期間的路由器負載平衡,與生產流量下的專家使用率,是兩個不同的問題,而這份報告只處理了前者。
數字,附帶著它們的標籤
這份報告的主要結果在輪廓上乾淨俐落,在細節上卻雜亂無章;而這種雜亂並不是醜聞——它是對三個同名但不同的對象所作的三種不同測量。
• DeepSWE v1.1(留出集)——MiMo-V2.6-Pro 在整段執行中從 58.4 升至 72.6;MiMo-V2.6-Flash 則從 48.7 升至 65.7。該基準包含 113 項長時程儲存庫工程任務,由五種程式語言的功能驗證器評判,而指標是 average@3——三次取樣嘗試的平均驗證器通過率,這與三次嘗試中是否有任何一次成功並不相同。把 avg@3 解讀為 pass@3,會高估頁面上的每一個數字。
• 同一個基準,在別處測得的結果——已發布的模型卡上,Pro 印出 71.9,Flash 印出 67.9。小米的公開訓練儀表板則印出 72.57 與 65.68。因此每個模型各有三個已公布的數字,其中兩個來自小米,而這對同系列型號的差異方向各不相同。它們沒有哪一個是錯的;它們分別描述的是儀表板快照、模型卡條目與報告中的一行,處於不同時間點,且可能使用不同的測試框架。
• 蒸餾 — MiMo-V2.6-Distill-Qwen-9B,以 MiMo 生成的示範資料對 Qwen3.5-9B 進行微調,將 SWE-bench Verified 從 61.1 提升到 66.2。這是論文中可轉移性最高的數字,因為 9B 的學生模型是大多數團隊實際上能負擔執行的規模。
• 一項內部的資安迷你基準測試 —— 31.3 至 47.0。內部就是內部:這些任務並未公開,因此這個差距即使在原則上也無法重現。
• Artificial Analysis 智慧指數 —— MiMo-V2.6-Pro 拿下 46 分。這個數字的性質與眾不同。它是由 Artificial Analysis 以自家評測框架對已釋出的檢查點(checkpoint)實測得出,而非由小米提供,這使得它成為本次發布中唯一一個讀者可以視為「實測」而非「轉述」的頭條數字。它同時也是用來與 GLM-5.3、Kimi K3 以及封閉陣營前沿模型相比較的數字,且比 Claude Opus 5 低了五分。


這份報告對自身表格的侷限相當誠實,而這句話值得拿去回敬任何不誠實的人:這些比較混雜了公開與內部基準,並未將強化學習的貢獻與架構或預訓練區隔開來。一個模型在經過強化學習後表現更好,並不證明強化學習就是原因。
還有第二個但書,而這正是與該論述框架相牴觸的一點。報告中的增益通常伴隨著 token 使用量上升。報告將其呈現為能力的持續提升,而非效率提升,而這麼做是對的。但 GAR 的明確設計目標是引導模型走向更短路徑,並降低每項任務的 token 用量,而整體結果並未顯示工作負載變得更便宜。能力提升了;每項任務的成本並未下降。如果你把「自我改進」理解為「模型下一季會需要我少花一點錢」,這篇論文並不支持這種解讀。
報告未經核實的內容
截至 2026 年 9 月 23 日,尚無任何第三方發表 DeepSWE、Terminal Bench 或 CyberGym 欄位的獨立重跑結果。真正關鍵的區別在於索引點與其他一切之間:46 是別人實際做出的測量值,而 72.6 則是針對一次無人能重新執行的訓練運行所提出的說法,因為據報導該次訓練運行 Pro 耗費了 260 萬美元、Flash 耗費了 90 萬美元,而且不會再發生第二次。
Xiaomi 確實公開了大多數實驗室不會公開的東西:訓練動態、強化學習框架與任務環境——涵蓋軟體工程、漏洞重現、知識工作與網頁設計的 7,000 多個分級環境。那才是保存期限最長的產物。權重告訴你這輪訓練產出了什麼;環境則告訴你如何自己執行這個實驗,而這是任何強化學習主張最終得以定論的唯一途徑。
針對獎勵駭取的防禦值得特別附加一項但書。它被描述為多層次——獎勵設計、對抗式評估、異常偵測,以及驗證器之間的交叉核對——而且這套描述完全出自一旦它失效就會顏面盡失的那一方。針對模型操弄以模型為基礎的評分器所設的防禦,並非自我報告所能結案的那種事。該機制被點名,失效模式也獲得承認,這比大多數論文做得更多,但它仍是個未解的問題。
你今天實際上能用這個做什麼
兩個檢查點皆可下載、無需權限控管,並採用 MIT 授權標籤:Xiaomi MiMo-V2.6-Pro-RL 與 Xiaomi MiMo-V2.6-Flash-RL,皆為全模態、具備 100 萬 token 上下文;其中 Flash 索引回報了 172.9 GB 的權重資料,分散於 65 個分片,格式為 FP8。小米尚未公布 V2.6 世代的每 token 費率表,因此如今的選擇,是在自行託管與你已付費使用的代管模型之間做取捨。
那個比較,正是這篇論文實用價值落腳之處,而它對這篇論文的評價並不好看——但這種不好看是有用的。受到檢驗的主張並不是「MiMo-V2.6-Pro 好不好」——那 46 個答案已經回答了這件事。而是「在混合式代理任務上做強化學習,所產生的推理能力究竟能不能遷移到我的工作負載上」,而要誠實回答這一點,唯一的方法就是兩者都跑、然後比較,而這在成為研究問題之前,先是個路由問題。DeepSeek-V4.1-Flash 只差一把 API 金鑰,每百萬 token 要價 0.15 與 0.60 美元,Qwen3.8-Flash 與 GLM-5.3-Flash 則共用同一把金鑰,而如果你想把自己託管的 MiMo 檢查點放到同一個端點後面跑上一週,看看 DeepSWE 曲線會不會出現在你自己的評估裡,那只是一次設定變更,而不是一次搬遷。OrcaRouter 並不代管小米的模型,這裡的任何內容也不該被解讀為如此宣稱——但你會拿來與它們對標的那些模型,全都可以透過一把 OrcaRouter API 金鑰,以供應商牌價、0% 加價原樣轉嫁取得,而且如果你正在試用的檢查點在高負載下顯得不穩定,還會自動容錯移轉。
未經實證的模型案例,正是容錯移轉機制存在的目的。兩天前發布的檢查點,附有廠商自行執行的評估,且沒有獨立重跑,正是你會想拿來試用、而不讓正式環境路徑依賴它的那種東西。
誰應該閱讀這篇論文?
如果你在做後訓練,請為了路由器那個發現和評分器成本數字去讀它。這兩者都可移植、測試起來都便宜,而且都不需要你相信任何關於 MiMo-V2.6 基準表的說法。尤其是凍結路由器的結果,這種東西花一個下午就能試,卻能省下整整一次訓練。
如果你正在挑選模型,讀那個指標分數就好,其餘的可以略過。Artificial Analysis 在發布的成品上測得 46;這是本次發布中唯一不是來自廠商的數字,而它讓 MiMo-V2.6-Pro 登上開放權重領域的頂端,並落後 Claude Opus 5 五分。報告中其餘內容都在描述小米如何走到這一步,而小米走到這一步的方式,並不是你花錢就買得到的。
而如果你讀的是報導,而不是論文,要注意的關鍵詞是「自我改進」。這份報告自身的結果顯示,能力會隨著 token 使用量一同提升,這是關於擴展強化學習的一項真實且可重現的發現。它並不是在聲稱模型跑起來變得更便宜;而接續這篇之後的論文,才會告訴你它最終是否會變得如此。
