
小米 MiMo-V2.6-Pro:72.57 的 DeepSWE 分數、一次中斷的運行,以及仍無发布日期
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro於 9 月 20 日停止了其公開直播的強化學習訓練,DeepSWE v1.1 分數為 72.57,顯示在小米自家的儀表板上——比 GPT-6 Astra、Gemini 3.8 Flash 與 Claude Opus 5 在同一排行榜頂端並列的 74% 低了 1.4 個百分點。與其一同訓練的較小模型 Xiaomi MiMo-V2.6-Flash 則於 9 月 19 日停在 65.68。兩次訓練都在第 30 步結束,而小米隨之公布的合計帳單顯示為 $3,474,715,這是我們今早擷取該頁面時所見的數字。
這就是好消息的全部,而它確實是好消息。故事的其餘部分,則是一個數字與一項產品之間的落差。Xiaomi MiMo-V2.6-Pro 和 Xiaomi MiMo-V2.6-Flash 都沒有發布日期、模型卡、API 識別碼、公開價格,也沒有可下載的權重。沒有可呼叫的端點。存在的只有一個任何人都能觀看的訓練儀表板、一項由 Xiaomi 自家測試框架產出的基準數據,以及一個花了六天時間盯著遙測頁面、就像人們以前讀茶葉占卜一樣的社群。
所以這是一篇「目前我們所知」的整理報導,而它誠實的版本會把過去一週報導悄悄混為一談的三件事分開:小米已經正式公開的內容、單一觀察者就此所報導的內容,以及這一切對今天正在挑選程式碼模型的人有何意義。
小米究竟在網上放了什麼
9月16日,由羅福莉領軍的 MiMo 團隊在小米自家網域開設了一個直播頁面,即時展示兩個尚未發布模型的後訓練過程:步數、獎勵曲線、token 吞吐量、沙箱數量、GPU 故障通知,以及一個會在你觀看時不斷往上跳動的成本計數器。根據相關報導,小米的說法是,它花了約六個月鑽研一個問題——強化學習的規模能擴展到什麼程度——並決定公開進行這項實驗,而非直接公布結果。
這個儀表板以廠商產物而言異常直言不諱。它在通知訊息流中列出自身的失敗:一次 Pro 在第 17 步重啟,原因是由專家負載失衡導致的 GPU 記憶體不足故障,團隊表示已透過調整訓練平行化策略修復;一起介於 Pro 訓練叢集與評分部署之間的網路連線故障,迫使系統重啟,並在「rollout 紀錄中出現不良模式」後決定從即將進行的 Pro 訓練中剔除該網路安全資料集;一次 Flash 自第 15 步重啟,此前有一類基礎設施錯誤約三小時未被偵測到;以及一次因單一節點上的 VRAM 故障而導致的 Pro 重啟。它還指出,被判定為「對當前 pro 模型而言相對容易」的任務已被過濾掉——這是大多數後訓練報告都避而不談的坦承。

這兩張執行卡片是任何追蹤時間安排的人最在意的部分。兩個模型都標記為 已停止:MiMo-V2.6-Pro 在歷經 5 天 7 小時的實際時間後停止,MiMo-V2.6-Flash 則是在 3 天 11 小時後,兩者都停在步驟 30,日期分別為 9 月 20 日與 9 月 19 日。Pro 為了其 262 萬美元消耗了 750 億個 token 與 75.3 萬個樣本;Flash 則消耗了 814 億個 token,花費 85.4 萬美元。每個步驟會抽取一批 1,568 個提示,每個提示有 16 次 rollout——也就是每個步驟 25,088 條軌跡,並以完全非同步的方式執行。
值得直說:Xiaomi 尚未說明「stopped」是指該次執行已完成、已暫停,還是已建立檢查點。一張停止的卡片並不是完成通知,而團隊以外沒有人知道它究竟是哪一種。
什麼是已確認的,什麼又不是
72.57 不是謠言。它就印在小米的儀表板上,在一張標示著 DeepSWE v1.1、mini-swe-agent、avg@3 的圖表裡,緊挨著 Pro 那一輪的橘色曲線。Flash 模型的 65.68 也在同一張圖表上。這個數字也出現在同一面板較早的快照中——先是 62.24,後來是 65.97——正是這一點賦予了這條曲線應有的形狀:橫跨 30 個步驟的穩定攀升,而非單一次僥倖的評估。
僅供報導的內容是起點。9 月 21 日在 X 上由帳號 @nrehiew_ 流傳的說法是,Pro 模型在 DeepSWE 上「從 58.41 進步到 72.57」,而且各次執行已經完成。終點與廠商儀表板完全吻合。58.41 這個基準是該帳號對曲線起點的判讀——圖表上最左側的 Pro 點確實落在 50 幾分的偏高區間——而小米並未公布第一步的數字。完成之說同樣是對兩張標示為已停止的卡片的解讀,這是合理的讀法,並非小米的聲明。請把這 14 點的進步視為方向上可靠、數值上僅為近似。

還有一個差異是這篇報導略過的,而這正是決定這個數字價值高低的關鍵。儀表板上的基準測試面板是小米自家的評估:該公司用自己的檢查點執行測試框架,並公布結果。這個測試框架與公開排行榜所用的相同——mini-swe-agent、DeepSWE v1.1——這讓該數字比廠商自研的基準測試更具可比性。但自行執行的評估並不等於排行榜上的登錄項目,而 72.57 並未出現在 Datacurve 的榜單上,因為沒有人提交過它。
74% 的上限比標題所暗示的更緊。
這讓這項比較成為焦點。Datacurve 的 DeepSWE v1.1 排行榜最後更新於 2026 年 9 月 3 日,列出橫跨 91 個儲存庫、涵蓋五種語言的 113 項任務,而其前三名配置以 74% Pass@1 並列:GPT-6 Astra 以 xhigh 推理強度、Gemini 3.8 Flash 以 high,以及 Claude Opus 5 以 max。真正有趣的,是緊鄰那些分數的數字。
• 信心 — GPT-6 Astra 74% ±3、Gemini 3.8 Flash 74% ±1、Claude Opus 5 74% ±4。在同一份榜單上,GPT-5.6 Sol 為 73% ±3,而 GLM-5.3 與 Kimi K3 為 69%。這些區間的重疊遠遠超過小數點後第二位。
• 每項任務成本——Gemini 3.8 Flash 平均為 $2.36,GPT-6 Astra 為 $6.52,Claude Opus 5 為 $11.84。排行榜自家的圖表便把 Gemini 3.8 Flash 標為榜上最具效率的配置,而這三者之間的落差約為五比一,換來的卻是該基準測試無法區辨的通過率。
• 步驟 — Gemini 3.8 Flash 每項任務平均需要 166 個代理步驟,Claude Opus 5 為 99,GPT-6 Astra 為 29。同分背後隱藏著三種截然不同的工作風格,而最便宜的那個,正是工作得最賣力的那個。

所以,當所報導的 72.57 被描述為「逼近榜首」時,更準確的說法其實更狹隘,也沒那麼戲劇化。它距離一組三方並列約在 1.5 分以內,而這三方彼此之間無法用該基準測試自身的誤差範圍區分開來。對於一個仍在後訓練階段的模型而言,這是個強勁的結果;它是由廠商而非該基準測試的維護者產出,且是在一個該模型尚未被提交到的排行榜上。排行榜上次更新完全早於小米的跑分,這就是為什麼上面還沒出現任何 MiMo 的原因。
為什麼小米要公開訓練?
這種透明度並非偶然。小米上一次的開放權重發布,是四月底推出的 Xiaomi MiMo-V2.5 與 Xiaomi MiMo-V2.5-Pro,兩者皆採用 MIT 授權——可商業使用、可微調、可再散布。MiMo-V2.5-Pro 是一套 1.02 兆參數的混合專家模型,具備 42B 活躍參數、混合注意力架構,以及 1M token 的脈絡視窗,而其發布資料也明確闡述了代理式(agentic)能力的種種主張:一個以 Rust 從零撰寫、橫跨數百次工具呼叫的編譯器,以及一套歷經十一小時代理工作所打造、共八千行的桌上型應用程式。
把下一代的後訓練過程直播出來,是一種不同性質的宣稱。一個即時公布自家獎勵曲線、沙盒數量與 GPU 故障的實驗室,是在要求外界以流程而非產品發表簡報來評判它,而且這也在預告一個時程。羅福莉表示,這項強化學習工作的技術細節將在接下來幾週內逐步開源。這是目前任何人所提出最接近時程表的東西:先方法論,後模型。
這也符合小米過去用過的一種模式:某個模型會先以另一個名稱公開亮相,之後公司才正式承認它。該公司的慣例是默默訓練、公開測試,然後連同權重一併發布。
你今天可以運行什麼
MiMo-V2.6 系列中沒有任何東西。如果你現在想要小米 MiMo 模型,現存的是 V2.5 世代——透過小米自家管道及數個第三方平台開放權重,並附有已發布的模型卡與定價。沒有 MiMo-V2.6 API、沒有模型識別碼,也沒有價目表,任何引用 MiMo-V2.6 識別碼或每 token 費率的頁面,都只是在填補小米留下的空白。儀表板上的 `mimo-v2.6-pro` 和 `mimo-v2.6-flash` 字串是訓練工作名稱,不是已發布的端點。
另一個實際的後果是:在這段等待期間該怎麼做。如果 MiMo-V2.6-Pro 讓你感興趣的原因,在於它可能是以更低成本達到前沿級程式編寫效能的一條路,那麼用來衡量它的那些配置現在就已經可以呼叫,而排行榜也顯示這個便宜的選擇極具競爭力:Gemini 3.8 Flash 以每項任務 2.36 美元並列最高通過率,並被標記為榜上效率最高的配置。Gemini 3.8 Flash、Claude Opus 5 與 GPT-6 Astra 全都可以透過單一 OrcaRouter API 金鑰,以供應商定價、0% 加成的方式取用——因此供應商調整價格當天就會在我們這邊生效,而不是等到下一個計費週期——而且容錯移轉是依模型設定,而非依供應商設定。而當某個實驗室真的開放像這樣的模型時,將它透過同一把金鑰來路由,是評估它的低投入方式:你可以讓它面對真實流量,而不必把正式生產路徑押在一個沒人摸清特性的檢查點上。
什麼才能真正改變這個故事
四個訊號,大致按照它們能解決問題的程度排列:
• 權重以明示授權條款發布於 Hugging Face,這正是 V2.5 世代問世的方式,也是最有力的證據,證明那次 RL 訓練產出的是一個可出貨的模型,而非一場就此結束的實驗。
• 一份載有參數量、上下文長度與架構的模型卡——V2.6 的這些數字都未公開,而儀表板也不會顯示它們。假設 V2.6-Pro 承襲 V2.5-Pro 的 1.02T/42B 組態,將會是猜測。
• 一個 API 識別碼和一張價格表,這一刻,DeepSWE 的數字成為採購決策,而非旁觀者的運動。
• 向 Datacurve 的 DeepSWE 排行榜提交結果,這會讓 MiMo-V2.6-Pro 與其所比較的模型列在同一張表上,並置於相同的誤差範圍之下。廠商自行執行的評估與排行榜提交並非同一種宣稱,而兩者之間的落差,恰恰就是那張表上的一列。
在那之前,誠實的總結是:Xiaomi 展現了任何主要實驗室所發表過最透明的後訓練流程,對象是兩款尚未推出的模型,並附上一項自行報告的基準數據,該數據接近——但並未登上——排行榜榜首。方法論的詳細報告承諾將在接下來幾週發布。至於發布日期,則完全沒有承諾。
