A hero title card reading 'Xiaomi MiMo-V2.6-Flash Is Out' over the subtitle '309B of open weights, MIT licence, 1M-token context - published 21 September 2026', with four pill badges: '309B total / 15B active', '173 GB of FP8 weights', '1M-token context' and 'Technical report included'.
Guides & Insights

小米 MiMo-V2.6-Flash 正式登場:一款可自行架設的 309B 開放模型

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

在 2026 年 9 月 21 日 15:39 UTC,MiMo-V2.6-Flash 不再是一項訓練任務;當時小米的 MiMo 團隊將檢查點發布為 XiaomiMiMo/MiMo-V2.6-Flash-RL 在 Hugging Face 上——無門檻、MIT 授權、附有技術報告,索引中有 65 個權重分片。 XiaomiMiMo/MiMo-V2.6-Pro-RL 在十八秒後隨之發布。一週前,這兩個模型在公開訓練儀表板上只是兩張標示為「已停止」的卡片,而關於它們被廣泛重複的說法是並不存在權重。現在它們是任何人都能下載並提供服務的檔案。這對你能用這個模型做的事來說是實質的改變,而這與關於某個模型的公告是兩回事。

先從時間戳談起,因為這次發布並沒有常見的廠商宣傳編排。小米自家的部落格在9月22日查閱時,最新貼文仍顯示為2025年12月的MiMo-V2-Flash發布。沒有V2.6的發布專文,沒有公布新一代的價格表,小米也沒有為這兩個檢查點宣布任何可呼叫的模型識別碼。實際存在的是:一個儲存庫、一份技術報告、部署配方,以及一組由廠商自行執行的基準測試表——外加模型卡裡一個不太友善的小細節,而這只有打算真正載入這個東西的人才會在意。

你可以持有的兩張卡片

兩個檢查點皆為原生全模態,並宣稱具備 100 萬 token 上下文,且兩者都採用 MIT 授權——可商業使用、可微調、可再散布,沒有營收門檻,也沒有研究條款。模型卡稱 Flash 是該系列中「效率均衡的檢查點」,而 Pro 是旗艦;有趣的是,當你查看配置而非行銷文案時,這兩者究竟有何不同。

• 參數量 — MiMo-V2.6-Flash 總計 309B,每個 token 啟用 15B;MiMo-V2.6-Pro 總計 1.02T,啟用 42B。兩者皆為稀疏混合專家模型。

• 主幹 — Flash 為 48 層(39 層滑動視窗、9 層全域注意力),隱藏大小 4096,256 個路由專家、啟用其中 8 個,128 個詞元的滑動視窗,無共享專家。第一個區塊為全域注意力搭配稠密前饋網路;其後的所有部分則交錯排列。

• 編碼器 — 一個 681M 參數的 MiMo ViT(28 層,24 層滑動視窗加 4 層全注意力)、一個 308M 音訊標記器,以及一個 127M 音訊區塊編碼器,因此文字、圖像、影片與音訊全都進入同一個模型,而非三條硬拼在一起的管線。

• 推測解碼 — 一個五層的多詞元預測草擬器(drafter),採 DFlash 風格,卡片中描述為每次前向傳遞可預測七個詞元,以供平行驗證。

• 儲存空間 — 已發布的索引報告指出,65 個分片中共有 172.9 GB 的權重資料,採用 FP8(e4m3)與動態激活方案。這相當於每個參數約九個位元組:Xiaomi 交付的是那個大模型,而不是將其量化成筆電大小的版本。

三個不一致的數字

這一點值得直說,因為這三者影響的都是部署決策,而非基準測試上的爭論,而且它們都不是什麼別有用心的事——它們看起來就像是說明文章、儲存庫頁面和實際隨附檔案之間的文件漂移。

第一個是推測解碼器。模型摘要說 MTP 頭是五層的草擬器,每次預測七個 token。config.json在同一個儲存庫中將 num_nextn_predict_layers設為 3。這兩個數字不可能描述同一個產物,而設定檔才是執行階段會讀取的。如果你正在為推測解碼估算記憶體,請相信設定檔,並在載入後驗證。

第二點更為微妙,與其說是錯誤,不如說是一種讀起來像錯誤的命名慣例。這個儲存庫叫做MiMo-V2.6-Flash-RL,這會讓人以為它是強化學習適配器,而非模型。它就是模型。-RL後綴標示的是後訓練血統——這個檢查點是Xiaomi直播的混合 RL 訓練產出,而不是疊在其他某個基礎模型上的 LoRA。權重索引也證實了這點:數以萬計的張量涵蓋了整個主幹、視覺編碼器、音訊堆疊與草稿模型。

如果你不是看規格卡,而是直接從儲存庫頁面來估算硬體需求,那首先遇到的會是第三個數字。該頁面上的 Safetensors 區塊顯示159B 參數。這既不是規格卡上的那兩個數字——不是 309B 總參數,也不是 15B 活躍參數——卻正是容量規劃者最可能直接複製的數字,因為它就緊鄰著下載按鈕。小米並未解釋這個差異,我們也無法從外部釐清;最合理的解讀是,這屬於量化張量的計算慣例,而非另一個模型。穩妥的做法是改以已公布的權重資料來估算:橫跨 65 個分片的 172.9 GB FP8,無論參數怎麼計算,這個數字都必須實實在在地以 VRAM 付出代價。

基準測試怎麼說,以及是誰執行的

以下每一個數字都來自 Xiaomi 在模型卡中自家提供的評估表。這些內容沒有任何一項經過獨立重現,也沒有任何一項出現在公開排行榜上,而比較欄位是廠商自己用相同測試框架對其他公司模型所跑的結果。請把結果的整體樣態視為有參考價值,並把小數位視為裝飾。

• 程式碼代理 — DeepSWE v1.1:Flash 67.9、Pro 71.9,對上 Claude Opus 5 的 74.0、GPT-5.6 Sol 的 73.0,以及 Claude Fable 5 的 70.0。在 Terminal Bench 2.1 上,Flash 達到 87.6,而 Opus 5 為 89.1——這個差距小到可能是由測試框架而非模型本身決定勝負。

• 通用型代理——AutomationBench v1.0.6 在小米的測試中,Flash 拿下 52.3,高於 GPT-5.6 Sol(45.8)與 Claude Opus 5(50.3)。Toolathlon-Verified:Flash 73.6、Pro 76.9、Opus 5 80.6。

• 網路安全——表格中最懸殊的一欄。CyberGym:Flash 拿下 95.1,高於自家體型更大的同系列模型 94.0,而 MiMo-V2.5-Pro 為 40.0。接著便直線探底:ExploitGym 中 Flash 僅 6.0,Opus 5 為 22.1;ExploitBench 25.3 對上 70.0;SEC Bench Pro 47.5,而 GPT-5.6 Sol 為 79.1。

• 視覺代理 — MiMo VisualCoding:Flash 71.5、Pro 72.3、Opus 5 70.0。

有一個數字值得特別挑出來談,因為這正是發表文通常會藏起來的那種東西。小米的 RL 儀表板公布了 Flash 在 DeepSWE v1.1 上拿到65.68——而模型卡現在對最終定案 checkpoint 的同一項基準測試,印出的是67.9。這兩者並不是同一項量測。儀表板上的數字標註的是 mini-swe-agent、avg@3,且是在訓練快照上測得;模型卡裡的表格則是廠商對已發布權重所做的離線評估。那兩分的差距,來自訓練後段所帶來的增益,再加上評估設定中任何有所變動之處,而目前小米以外沒有人能把這兩者拆開來看。如果你從上週以來一直引用 65.68,那現在它已是過時數字,而且對應的是另一個不同的產物。

A screenshot of the XiaomiMiMo/MiMo-V2.6-Flash-RL repository page on Hugging Face, showing the MIT licence tag, the Safetensors block reporting 'Model size 159B params' and 'This model isn't deployed by any Inference Provider', and the repository file listing that includes the technical report and the weight shards.

實際運行它需要多少成本

開放權重是一種許可,而非一張帳單,而這正是發布開始不那麼值得慶祝的地方。模型卡本身的部署章節建議使用 SGLang(張量平行 16、資料平行 2,並啟用 EAGLE 風格的多層推測路徑),或採用張量平行 8 的 vLLM 配方,並指出穩定版 vLLM 可能落後於該架構。對於一個權重就佔約 173 GB 的 309B 模型來說,這是一項多節點服務工作——而這還沒算上 1M token 脈絡所需的 KV 快取。建議的取樣設定為 temperature 1.0、top_p 0.95。

所以,這裡對「開源」的誠實說法是:小米移除了授權障礙,卻讓硬體障礙原封不動。現在,用你自己的追蹤資料微調 Flash 既合法又可行;但要在任何比正經 GPU 節點更小的裝置上這麼做,則不可行。這與託管端點是實實在在且不同的方案,而這正是為什麼使用這一代模型的兩種方式並不互相競爭——它們涵蓋不同的預算。

如果你想要具備這種能力卻不想買節點,小米在那張表裡拿來對標的模型就是實務上的替代方案:GPT-5.6 Sol、Claude Opus 5 和 Claude Fable 5 今天全都能呼叫,而且它們只要一組 API 金鑰就能依供應商定價取用,在 OrcaRouter 上以 0% 加價轉供,所以你真正在做的決定是「買一顆節點」還是「按呼叫量計費」。如果你想在做出選擇之前,先看看可呼叫的這一層級在相同程式設計任務上表現如何,程式設計排行榜會比廠商那張表更快看出端倪。如今在任何路由器上都辦不到的事,就是直接呼叫 MiMo-V2.6-Flash 本身——我們不路由任何小米模型,而小米自家規格卡上的供應狀況那行也指向小米自家的管道:MiMo API 平台、AI Studio、MiMo Code 以及桌面應用程式。

A single-column scoreboard headed 'MiMo-V2.6-Flash - the numbers that decide a deployment', listing 309B total and 15B activated parameters, a 1M-token context, text/image/video/audio modalities, the MIT licence with no revenue cap, 172.9 GB of FP8 weights across 65 shards, DeepSWE v1.1 at 67.9 against 74.0 for Claude Opus 5, CyberGym at 95.1, and SGLang tp16/dp2 or vLLM tp8 serving with no vendor price published.

定價問題仍然懸而未決

小米尚未公布 MiMo-V2.6-Flash 的每 token 費率。關於此次發布的報導指出,該系列將沿用 MiMo-V2.5 的 API 定價,而這是媒體的說法,並非官方的價目表——V2.5 世代已公布的海外費率約為每百萬輸入 token 0.1 美元,快取輸入則便宜一個數量級,但小米網站上沒有任何內容證實新的檢查點會繼承這些價格。在價目表出現之前,你看到的任何 MiMo-V2.6 端點價格數字都只是某人的推論。

還有兩件事仍付之闕如,而且這兩件事都列在小米自己的待辦清單上,而非其他人的。羅福莉在 RL 直播中的說法是,訓練環境與 RL 程式碼將會開源,發布資料也重申了這項承諾;目前這些儲存庫提供的是權重、技術報告與部署說明,而不是訓練堆疊。而且也沒有獨立評估:沒有提交到排行榜,也沒有第三方重跑 DeepSWE 或 CyberGym 欄位。對於任何正在決定一個擁有 15B 活躍預算的 309B 模型是否值得佔用一個節點的人來說,這正是最關鍵的落差。

什麼會改變局面?

三個訊號值得留意,大致按照它們能多大程度左右一項決策的順序排列。一份公開的價目表,會讓它從一個自架專案,變成一個你能拿來與託管前沿方案相比較的單項支出。由第三方在相同測試框架上跑出的結果——DeepSWE 或 Terminal Bench,是提交而非自報的——將能確定 67.9 究竟是真實的定位,還是對自己有利的設定。而 RL 環境,如果真的落地,對大多數團隊來說會是更有意思的產物,因為你正需要它們,才能在自己的資料上重現自我改進迴圈。

在那之前,對這次發布的務實解讀既狹隘又清楚。MiMo-V2.6-Flash 是一個貨真價實的開放權重、MIT 授權的全模態代理模型,其規模預設了要有一整個叢集才能運行——而它是 MiMo-V2.6 世代中第一個你能真正握在手中的檢查點,這一點在上週還完全無從說起。

A screenshot of Xiaomi's MiMo blog, captured 22 September 2026, showing the site navigation and the December 16, 2025 post 'Introducing MiMo-V2-Flash' as the newest entry, with the line 'Today, we are releasing and open-sourcing MiMo-V2-Flash', the availability note listing Hugging Face, the API Platform and AI Studio, and a 'Benchmark Comparison' table with columns for SWE-Bench Verified, SWE-Bench Multilingual, Tau2-Bench, AIME25, GPQA-Diamond, HLE and Arena-Hard.

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新