文章《Xiaomi MiMo-V2.6-Pro:在 DeepSWE 上取得 72.57》的主視覺標題卡,上方引題為「OrcaRouter · 模型雷達 — 尚未發布」,副標題為「一場中止的執行、一個尚未出貨的模型——哪些已確認,哪些沒有。」下方兩張卡片:左側「小米自家儀表板上」,內容為「DeepSWE v1.1:72.57 — 執行於第 30 步中止,9 月 20 日」;右側「仍未公開」,內容為「沒有模型卡、沒有 API id、沒有價格、沒有權重」。四個標籤寫著「Flash 同系列:65.68」、「總支出:$3,474,715」、「榜首:74%」以及「廠商自行執行的評估,非提交結果」。OrcaRouter 標誌合成於右下角。
Guides & Insights

小米 MiMo-V2.6-Pro:72.57 的 DeepSWE 分數、一次中斷的運行,以及仍無发布日期

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Xiaomi MiMo-V2.6-Pro於 9 月 20 日停止了其公開直播的強化學習訓練,DeepSWE v1.1 分數為 72.57,顯示在小米自家的儀表板上——比 GPT-6 AstraGemini 3.8 FlashClaude Opus 5 在同一排行榜頂端並列的 74% 低了 1.4 個百分點。與其一同訓練的較小模型 Xiaomi MiMo-V2.6-Flash 則於 9 月 19 日停在 65.68。兩次訓練都在第 30 步結束,而小米隨之公布的合計帳單顯示為 $3,474,715,這是我們今早擷取該頁面時所見的數字。

這就是好消息的全部,而它確實是好消息。故事的其餘部分,則是一個數字與一項產品之間的落差。Xiaomi MiMo-V2.6-Pro 和 Xiaomi MiMo-V2.6-Flash 都沒有發布日期、模型卡、API 識別碼、公開價格,也沒有可下載的權重。沒有可呼叫的端點。存在的只有一個任何人都能觀看的訓練儀表板、一項由 Xiaomi 自家測試框架產出的基準數據,以及一個花了六天時間盯著遙測頁面、就像人們以前讀茶葉占卜一樣的社群。

所以這是一篇「目前我們所知」的整理報導,而它誠實的版本會把過去一週報導悄悄混為一談的三件事分開:小米已經正式公開的內容、單一觀察者就此所報導的內容,以及這一切對今天正在挑選程式碼模型的人有何意義。

小米究竟在網上放了什麼

9月16日,由羅福莉領軍的 MiMo 團隊在小米自家網域開設了一個直播頁面,即時展示兩個尚未發布模型的後訓練過程:步數、獎勵曲線、token 吞吐量、沙箱數量、GPU 故障通知,以及一個會在你觀看時不斷往上跳動的成本計數器。根據相關報導,小米的說法是,它花了約六個月鑽研一個問題——強化學習的規模能擴展到什麼程度——並決定公開進行這項實驗,而非直接公布結果。

這個儀表板以廠商產物而言異常直言不諱。它在通知訊息流中列出自身的失敗:一次 Pro 在第 17 步重啟,原因是由專家負載失衡導致的 GPU 記憶體不足故障,團隊表示已透過調整訓練平行化策略修復;一起介於 Pro 訓練叢集與評分部署之間的網路連線故障,迫使系統重啟,並在「rollout 紀錄中出現不良模式」後決定從即將進行的 Pro 訓練中剔除該網路安全資料集;一次 Flash 自第 15 步重啟,此前有一類基礎設施錯誤約三小時未被偵測到;以及一次因單一節點上的 VRAM 故障而導致的 Pro 重啟。它還指出,被判定為「對當前 pro 模型而言相對容易」的任務已被過濾掉——這是大多數後訓練報告都避而不談的坦承。

Screenshot of Xiaomi's public MiMo-V2.6 reinforcement-learning dashboard captured September 21, 2026. A total-cost counter reads $3,474,715, and a notices feed lists a Pro restart at step 17 from a GPU out-of-memory fault caused by expert load imbalance, a network connectivity fault between the Pro training cluster and the grader deployment, a Flash restart from step 15 after an infrastructure error went undetected for about three hours, a Pro restart from a node VRAM fault, and a note that tasks relatively easy for the current Pro model were filtered out. Two run cards show mimo-v2.6-pro stopped at step 30 — started 2026-09-15 10:32 UTC, stopped 2026-09-20, $2,620,670 spent, 75B tokens, 753k samples, batch 1,568 x 16 — and mimo-v2.6-flash stopped at step 30 — started 2026-09-15 15:16 UTC, stopped 2026-09-19, $854,044 spent, 81.4B tokens. Three benchmark panels read DeepSWE v1.1 mini-swe-agent avg@3: mimo-v2.6-pro 72.57, mimo-v2.6-flash 65.68; an in-house coding bench at 65.43 and 62.87; and AutomationBench v1.0.6 at 53.10 and 52.70.

這兩張執行卡片是任何追蹤時間安排的人最在意的部分。兩個模型都標記為 已停止:MiMo-V2.6-Pro 在歷經 5 天 7 小時的實際時間後停止,MiMo-V2.6-Flash 則是在 3 天 11 小時後,兩者都停在步驟 30,日期分別為 9 月 20 日與 9 月 19 日。Pro 為了其 262 萬美元消耗了 750 億個 token 與 75.3 萬個樣本;Flash 則消耗了 814 億個 token,花費 85.4 萬美元。每個步驟會抽取一批 1,568 個提示,每個提示有 16 次 rollout——也就是每個步驟 25,088 條軌跡,並以完全非同步的方式執行。

值得直說:Xiaomi 尚未說明「stopped」是指該次執行已完成、已暫停,還是已建立檢查點。一張停止的卡片並不是完成通知,而團隊以外沒有人知道它究竟是哪一種。

什麼是已確認的,什麼又不是

72.57 不是謠言。它就印在小米的儀表板上,在一張標示著 DeepSWE v1.1、mini-swe-agent、avg@3 的圖表裡,緊挨著 Pro 那一輪的橘色曲線。Flash 模型的 65.68 也在同一張圖表上。這個數字也出現在同一面板較早的快照中——先是 62.24,後來是 65.97——正是這一點賦予了這條曲線應有的形狀:橫跨 30 個步驟的穩定攀升,而非單一次僥倖的評估。

僅供報導的內容是起點。9 月 21 日在 X 上由帳號 @nrehiew_ 流傳的說法是,Pro 模型在 DeepSWE 上「從 58.41 進步到 72.57」,而且各次執行已經完成。終點與廠商儀表板完全吻合。58.41 這個基準是該帳號對曲線起點的判讀——圖表上最左側的 Pro 點確實落在 50 幾分的偏高區間——而小米並未公布第一步的數字。完成之說同樣是對兩張標示為已停止的卡片的解讀,這是合理的讀法,並非小米的聲明。請把這 14 點的進步視為方向上可靠、數值上僅為近似。

A two-column scoreboard titled 'MiMo-V2.6-Pro vs the DeepSWE top tier', subtitled 'What Xiaomi published about its own checkpoint, against what the public leaderboard lists — September 21, 2026'. The left column, badged VENDOR-REPORTED and headed 'MiMo-V2.6-Pro', reads: DeepSWE v1.1 — 72.57; Basis — Xiaomi's own offline eval, mini-swe-agent avg@3; Confidence — not published; Cost per task — not published; Release — not announced; Independent runs — none. The right column, badged PUBLIC LEADERBOARD and headed 'Top tier — three-way tie', reads: DeepSWE v1.1 — 74%; Basis — submitted configs, Pass@1, GPT-6 Astra · Gemini 3.8 Flash · Claude Opus 5; Confidence — plus or minus 1 to 4 points; Cost per task — $2.36 to $11.84; Release — shipping today; Independent runs — on the public board. A footer reads 'MiMo-V2.6-Pro is Xiaomi's own offline evaluation, read from the vendor's public RL dashboard on 2026-09-21 and not submitted to the leaderboard. Top-tier figures per Datacurve's DeepSWE v1.1 leaderboard, updated 2026-09-03.' The OrcaRouter logo is composited in the bottom-right corner.

還有一個差異是這篇報導略過的,而這正是決定這個數字價值高低的關鍵。儀表板上的基準測試面板是小米自家的評估:該公司用自己的檢查點執行測試框架,並公布結果。這個測試框架與公開排行榜所用的相同——mini-swe-agent、DeepSWE v1.1——這讓該數字比廠商自研的基準測試更具可比性。但自行執行的評估並不等於排行榜上的登錄項目,而 72.57 並未出現在 Datacurve 的榜單上,因為沒有人提交過它。

74% 的上限比標題所暗示的更緊。

這讓這項比較成為焦點。Datacurve 的 DeepSWE v1.1 排行榜最後更新於 2026 年 9 月 3 日,列出橫跨 91 個儲存庫、涵蓋五種語言的 113 項任務,而其前三名配置以 74% Pass@1 並列:GPT-6 Astra 以 xhigh 推理強度、Gemini 3.8 Flash 以 high,以及 Claude Opus 5 以 max。真正有趣的,是緊鄰那些分數的數字。

• 信心 — GPT-6 Astra 74% ±3、Gemini 3.8 Flash 74% ±1、Claude Opus 5 74% ±4。在同一份榜單上,GPT-5.6 Sol 為 73% ±3,而 GLM-5.3Kimi K3 為 69%。這些區間的重疊遠遠超過小數點後第二位。

• 每項任務成本——Gemini 3.8 Flash 平均為 $2.36,GPT-6 Astra 為 $6.52,Claude Opus 5 為 $11.84。排行榜自家的圖表便把 Gemini 3.8 Flash 標為榜上最具效率的配置,而這三者之間的落差約為五比一,換來的卻是該基準測試無法區辨的通過率。

• 步驟 — Gemini 3.8 Flash 每項任務平均需要 166 個代理步驟,Claude Opus 5 為 99,GPT-6 Astra 為 29。同分背後隱藏著三種截然不同的工作風格,而最便宜的那個,正是工作得最賣力的那個。

Screenshot of Datacurve's DeepSWE v1.1 leaderboard captured September 21, 2026, showing 113 tasks, 91 repositories, five languages and 28 models, with the v1.1 and Best tabs selected and the board marked 'updated September 3, 2026'. The Pass@1 table lists gpt-6-astra (xhigh) at 74 percent plus or minus 3 with an average cost of $6.52, 30k output tokens and 29 steps; gemini-3.8-flash (high) at 74 percent plus or minus 1 at $2.36, 143k tokens and 166 steps; claude-opus-5 (max) at 74 percent plus or minus 4 at $11.84, 118k tokens and 99 steps; gpt-5.6-sol at 73 percent; claude-fable-5 at 70 percent; glm-5.3 and kimi-k3 at 69 percent; and grok-4.6 and gpt-5.6-luna at 67 percent. The score-versus-average-cost chart above the table labels gemini-3.8-flash as the most efficient configuration. No Xiaomi MiMo model appears on the board.

所以,當所報導的 72.57 被描述為「逼近榜首」時,更準確的說法其實更狹隘,也沒那麼戲劇化。它距離一組三方並列約在 1.5 分以內,而這三方彼此之間無法用該基準測試自身的誤差範圍區分開來。對於一個仍在後訓練階段的模型而言,這是個強勁的結果;它是由廠商而非該基準測試的維護者產出,且是在一個該模型尚未被提交到的排行榜上。排行榜上次更新完全早於小米的跑分,這就是為什麼上面還沒出現任何 MiMo 的原因。

為什麼小米要公開訓練?

這種透明度並非偶然。小米上一次的開放權重發布,是四月底推出的 Xiaomi MiMo-V2.5 與 Xiaomi MiMo-V2.5-Pro,兩者皆採用 MIT 授權——可商業使用、可微調、可再散布。MiMo-V2.5-Pro 是一套 1.02 兆參數的混合專家模型,具備 42B 活躍參數、混合注意力架構,以及 1M token 的脈絡視窗,而其發布資料也明確闡述了代理式(agentic)能力的種種主張:一個以 Rust 從零撰寫、橫跨數百次工具呼叫的編譯器,以及一套歷經十一小時代理工作所打造、共八千行的桌上型應用程式。

把下一代的後訓練過程直播出來,是一種不同性質的宣稱。一個即時公布自家獎勵曲線、沙盒數量與 GPU 故障的實驗室,是在要求外界以流程而非產品發表簡報來評判它,而且這也在預告一個時程。羅福莉表示,這項強化學習工作的技術細節將在接下來幾週內逐步開源。這是目前任何人所提出最接近時程表的東西:先方法論,後模型。

這也符合小米過去用過的一種模式:某個模型會先以另一個名稱公開亮相,之後公司才正式承認它。該公司的慣例是默默訓練、公開測試,然後連同權重一併發布。

你今天可以運行什麼

MiMo-V2.6 系列中沒有任何東西。如果你現在想要小米 MiMo 模型,現存的是 V2.5 世代——透過小米自家管道及數個第三方平台開放權重,並附有已發布的模型卡與定價。沒有 MiMo-V2.6 API、沒有模型識別碼,也沒有價目表,任何引用 MiMo-V2.6 識別碼或每 token 費率的頁面,都只是在填補小米留下的空白。儀表板上的 `mimo-v2.6-pro` 和 `mimo-v2.6-flash` 字串是訓練工作名稱,不是已發布的端點。

另一個實際的後果是:在這段等待期間該怎麼做。如果 MiMo-V2.6-Pro 讓你感興趣的原因,在於它可能是以更低成本達到前沿級程式編寫效能的一條路,那麼用來衡量它的那些配置現在就已經可以呼叫,而排行榜也顯示這個便宜的選擇極具競爭力:Gemini 3.8 Flash 以每項任務 2.36 美元並列最高通過率,並被標記為榜上效率最高的配置。Gemini 3.8 Flash、Claude Opus 5 與 GPT-6 Astra 全都可以透過單一 OrcaRouter API 金鑰,以供應商定價、0% 加成的方式取用——因此供應商調整價格當天就會在我們這邊生效,而不是等到下一個計費週期——而且容錯移轉是依模型設定,而非依供應商設定。而當某個實驗室真的開放像這樣的模型時,將它透過同一把金鑰來路由,是評估它的低投入方式:你可以讓它面對真實流量,而不必把正式生產路徑押在一個沒人摸清特性的檢查點上。

什麼才能真正改變這個故事

四個訊號,大致按照它們能解決問題的程度排列:

• 權重以明示授權條款發布於 Hugging Face,這正是 V2.5 世代問世的方式,也是最有力的證據,證明那次 RL 訓練產出的是一個可出貨的模型,而非一場就此結束的實驗。

• 一份載有參數量、上下文長度與架構的模型卡——V2.6 的這些數字都未公開,而儀表板也不會顯示它們。假設 V2.6-Pro 承襲 V2.5-Pro 的 1.02T/42B 組態,將會是猜測。

• 一個 API 識別碼和一張價格表,這一刻,DeepSWE 的數字成為採購決策,而非旁觀者的運動。

• 向 Datacurve 的 DeepSWE 排行榜提交結果,這會讓 MiMo-V2.6-Pro 與其所比較的模型列在同一張表上,並置於相同的誤差範圍之下。廠商自行執行的評估與排行榜提交並非同一種宣稱,而兩者之間的落差,恰恰就是那張表上的一列。

在那之前,誠實的總結是:Xiaomi 展現了任何主要實驗室所發表過最透明的後訓練流程,對象是兩款尚未推出的模型,並附上一項自行報告的基準數據,該數據接近——但並未登上——排行榜榜首。方法論的詳細報告承諾將在接下來幾週發布。至於發布日期,則完全沒有承諾。