
小米 MiMo-V2.6-Flash 正式登場:一款可自行架設的 309B 開放模型
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
在 2026 年 9 月 21 日 15:39 UTC,MiMo-V2.6-Flash 不再是一項訓練任務;當時小米的 MiMo 團隊將檢查點發布為 XiaomiMiMo/MiMo-V2.6-Flash-RL 在 Hugging Face 上——無門檻、MIT 授權、附有技術報告,索引中有 65 個權重分片。 XiaomiMiMo/MiMo-V2.6-Pro-RL 在十八秒後隨之發布。一週前,這兩個模型在公開訓練儀表板上只是兩張標示為「已停止」的卡片,而關於它們被廣泛重複的說法是並不存在權重。現在它們是任何人都能下載並提供服務的檔案。這對你能用這個模型做的事來說是實質的改變,而這與關於某個模型的公告是兩回事。
先從時間戳談起,因為這次發布並沒有常見的廠商宣傳編排。小米自家的部落格在9月22日查閱時,最新貼文仍顯示為2025年12月的MiMo-V2-Flash發布。沒有V2.6的發布專文,沒有公布新一代的價格表,小米也沒有為這兩個檢查點宣布任何可呼叫的模型識別碼。實際存在的是:一個儲存庫、一份技術報告、部署配方,以及一組由廠商自行執行的基準測試表——外加模型卡裡一個不太友善的小細節,而這只有打算真正載入這個東西的人才會在意。
你可以持有的兩張卡片
兩個檢查點皆為原生全模態,並宣稱具備 100 萬 token 上下文,且兩者都採用 MIT 授權——可商業使用、可微調、可再散布,沒有營收門檻,也沒有研究條款。模型卡稱 Flash 是該系列中「效率均衡的檢查點」,而 Pro 是旗艦;有趣的是,當你查看配置而非行銷文案時,這兩者究竟有何不同。
• 參數量 — MiMo-V2.6-Flash 總計 309B,每個 token 啟用 15B;MiMo-V2.6-Pro 總計 1.02T,啟用 42B。兩者皆為稀疏混合專家模型。
• 主幹 — Flash 為 48 層(39 層滑動視窗、9 層全域注意力),隱藏大小 4096,256 個路由專家、啟用其中 8 個,128 個詞元的滑動視窗,無共享專家。第一個區塊為全域注意力搭配稠密前饋網路;其後的所有部分則交錯排列。
• 編碼器 — 一個 681M 參數的 MiMo ViT(28 層,24 層滑動視窗加 4 層全注意力)、一個 308M 音訊標記器,以及一個 127M 音訊區塊編碼器,因此文字、圖像、影片與音訊全都進入同一個模型,而非三條硬拼在一起的管線。
• 推測解碼 — 一個五層的多詞元預測草擬器(drafter),採 DFlash 風格,卡片中描述為每次前向傳遞可預測七個詞元,以供平行驗證。
• 儲存空間 — 已發布的索引報告指出,65 個分片中共有 172.9 GB 的權重資料,採用 FP8(e4m3)與動態激活方案。這相當於每個參數約九個位元組:Xiaomi 交付的是那個大模型,而不是將其量化成筆電大小的版本。
三個不一致的數字
這一點值得直說,因為這三者影響的都是部署決策,而非基準測試上的爭論,而且它們都不是什麼別有用心的事——它們看起來就像是說明文章、儲存庫頁面和實際隨附檔案之間的文件漂移。
第一個是推測解碼器。模型摘要說 MTP 頭是五層的草擬器,每次預測七個 token。config.json在同一個儲存庫中將 num_nextn_predict_layers設為 3。這兩個數字不可能描述同一個產物,而設定檔才是執行階段會讀取的。如果你正在為推測解碼估算記憶體,請相信設定檔,並在載入後驗證。
第二點更為微妙,與其說是錯誤,不如說是一種讀起來像錯誤的命名慣例。這個儲存庫叫做MiMo-V2.6-Flash-RL,這會讓人以為它是強化學習適配器,而非模型。它就是模型。-RL後綴標示的是後訓練血統——這個檢查點是Xiaomi直播的混合 RL 訓練產出,而不是疊在其他某個基礎模型上的 LoRA。權重索引也證實了這點:數以萬計的張量涵蓋了整個主幹、視覺編碼器、音訊堆疊與草稿模型。
如果你不是看規格卡,而是直接從儲存庫頁面來估算硬體需求,那首先遇到的會是第三個數字。該頁面上的 Safetensors 區塊顯示159B 參數。這既不是規格卡上的那兩個數字——不是 309B 總參數,也不是 15B 活躍參數——卻正是容量規劃者最可能直接複製的數字,因為它就緊鄰著下載按鈕。小米並未解釋這個差異,我們也無法從外部釐清;最合理的解讀是,這屬於量化張量的計算慣例,而非另一個模型。穩妥的做法是改以已公布的權重資料來估算:橫跨 65 個分片的 172.9 GB FP8,無論參數怎麼計算,這個數字都必須實實在在地以 VRAM 付出代價。
基準測試怎麼說,以及是誰執行的
以下每一個數字都來自 Xiaomi 在模型卡中自家提供的評估表。這些內容沒有任何一項經過獨立重現,也沒有任何一項出現在公開排行榜上,而比較欄位是廠商自己用相同測試框架對其他公司模型所跑的結果。請把結果的整體樣態視為有參考價值,並把小數位視為裝飾。
• 程式碼代理 — DeepSWE v1.1:Flash 67.9、Pro 71.9,對上 Claude Opus 5 的 74.0、GPT-5.6 Sol 的 73.0,以及 Claude Fable 5 的 70.0。在 Terminal Bench 2.1 上,Flash 達到 87.6,而 Opus 5 為 89.1——這個差距小到可能是由測試框架而非模型本身決定勝負。
• 通用型代理——AutomationBench v1.0.6 在小米的測試中,Flash 拿下 52.3,高於 GPT-5.6 Sol(45.8)與 Claude Opus 5(50.3)。Toolathlon-Verified:Flash 73.6、Pro 76.9、Opus 5 80.6。
• 網路安全——表格中最懸殊的一欄。CyberGym:Flash 拿下 95.1,高於自家體型更大的同系列模型 94.0,而 MiMo-V2.5-Pro 為 40.0。接著便直線探底:ExploitGym 中 Flash 僅 6.0,Opus 5 為 22.1;ExploitBench 25.3 對上 70.0;SEC Bench Pro 47.5,而 GPT-5.6 Sol 為 79.1。
• 視覺代理 — MiMo VisualCoding:Flash 71.5、Pro 72.3、Opus 5 70.0。
有一個數字值得特別挑出來談,因為這正是發表文通常會藏起來的那種東西。小米的 RL 儀表板公布了 Flash 在 DeepSWE v1.1 上拿到65.68——而模型卡現在對最終定案 checkpoint 的同一項基準測試,印出的是67.9。這兩者並不是同一項量測。儀表板上的數字標註的是 mini-swe-agent、avg@3,且是在訓練快照上測得;模型卡裡的表格則是廠商對已發布權重所做的離線評估。那兩分的差距,來自訓練後段所帶來的增益,再加上評估設定中任何有所變動之處,而目前小米以外沒有人能把這兩者拆開來看。如果你從上週以來一直引用 65.68,那現在它已是過時數字,而且對應的是另一個不同的產物。

實際運行它需要多少成本
開放權重是一種許可,而非一張帳單,而這正是發布開始不那麼值得慶祝的地方。模型卡本身的部署章節建議使用 SGLang(張量平行 16、資料平行 2,並啟用 EAGLE 風格的多層推測路徑),或採用張量平行 8 的 vLLM 配方,並指出穩定版 vLLM 可能落後於該架構。對於一個權重就佔約 173 GB 的 309B 模型來說,這是一項多節點服務工作——而這還沒算上 1M token 脈絡所需的 KV 快取。建議的取樣設定為 temperature 1.0、top_p 0.95。
所以,這裡對「開源」的誠實說法是:小米移除了授權障礙,卻讓硬體障礙原封不動。現在,用你自己的追蹤資料微調 Flash 既合法又可行;但要在任何比正經 GPU 節點更小的裝置上這麼做,則不可行。這與託管端點是實實在在且不同的方案,而這正是為什麼使用這一代模型的兩種方式並不互相競爭——它們涵蓋不同的預算。
如果你想要具備這種能力卻不想買節點,小米在那張表裡拿來對標的模型就是實務上的替代方案:GPT-5.6 Sol、Claude Opus 5 和 Claude Fable 5 今天全都能呼叫,而且它們只要一組 API 金鑰就能依供應商定價取用,在 OrcaRouter 上以 0% 加價轉供,所以你真正在做的決定是「買一顆節點」還是「按呼叫量計費」。如果你想在做出選擇之前,先看看可呼叫的這一層級在相同程式設計任務上表現如何,程式設計排行榜會比廠商那張表更快看出端倪。如今在任何路由器上都辦不到的事,就是直接呼叫 MiMo-V2.6-Flash 本身——我們不路由任何小米模型,而小米自家規格卡上的供應狀況那行也指向小米自家的管道:MiMo API 平台、AI Studio、MiMo Code 以及桌面應用程式。

定價問題仍然懸而未決
小米尚未公布 MiMo-V2.6-Flash 的每 token 費率。關於此次發布的報導指出,該系列將沿用 MiMo-V2.5 的 API 定價,而這是媒體的說法,並非官方的價目表——V2.5 世代已公布的海外費率約為每百萬輸入 token 0.1 美元,快取輸入則便宜一個數量級,但小米網站上沒有任何內容證實新的檢查點會繼承這些價格。在價目表出現之前,你看到的任何 MiMo-V2.6 端點價格數字都只是某人的推論。
還有兩件事仍付之闕如,而且這兩件事都列在小米自己的待辦清單上,而非其他人的。羅福莉在 RL 直播中的說法是,訓練環境與 RL 程式碼將會開源,發布資料也重申了這項承諾;目前這些儲存庫提供的是權重、技術報告與部署說明,而不是訓練堆疊。而且也沒有獨立評估:沒有提交到排行榜,也沒有第三方重跑 DeepSWE 或 CyberGym 欄位。對於任何正在決定一個擁有 15B 活躍預算的 309B 模型是否值得佔用一個節點的人來說,這正是最關鍵的落差。
什麼會改變局面?
三個訊號值得留意,大致按照它們能多大程度左右一項決策的順序排列。一份公開的價目表,會讓它從一個自架專案,變成一個你能拿來與託管前沿方案相比較的單項支出。由第三方在相同測試框架上跑出的結果——DeepSWE 或 Terminal Bench,是提交而非自報的——將能確定 67.9 究竟是真實的定位,還是對自己有利的設定。而 RL 環境,如果真的落地,對大多數團隊來說會是更有意思的產物,因為你正需要它們,才能在自己的資料上重現自我改進迴圈。
在那之前,對這次發布的務實解讀既狹隘又清楚。MiMo-V2.6-Flash 是一個貨真價實的開放權重、MIT 授權的全模態代理模型,其規模預設了要有一整個叢集才能運行——而它是 MiMo-V2.6 世代中第一個你能真正握在手中的檢查點,這一點在上週還完全無從說起。

本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
