
MiMo-V2.6-Flash 對比 MiMo-V2.6:同系列,兩個檢查點,一名兩用
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
問兩個人 MiMo-V2.6 是什麼,你可能會得到兩個不同的模型。Xiaomi 在 2026 年 9 月發表的是一個系列,包含兩個已公布的檢查點——MiMo-V2.6-Flash有 3,090 億個參數,而MiMo-V2.6-Pro有 1.02 兆個——而單獨的 MiMo-V2.6這個名稱,既用來指整個系列,在多數報導中也用來指該世代的最頂規版本。所以一個標題寫著「MiMo-V2.6-Flash vs MiMo-V2.6」的頁面,其實是把效率檢查點拿來對比人們指稱旗艦時所寫的名稱。兩個檢查點都在 2026 年 9 月 21 日相隔十八秒登上 Hugging Face,兩者都採用 MIT 授權,而且兩者都是以可下載為優先——沒有 Xiaomi 端點可供呼叫。除此之外,它們幾乎沒有其他相同之處。
這件事比一般名稱之爭來得重要,因為這兩者並不是一種日後還能往上爬的規模階梯。它們是兩次各自獨立的訓練,各自有基準測試表、各自的記憶體佔用量,而且——正如已公布的數字所示——有幾個地方還是較小者徹底勝出。
兩個檢查點,一分鐘發布
這兩個儲存庫分別是 XiaomiMiMo/MiMo-V2.6-Flash-RL(建立於 UTC 15:39:51)與 XiaomiMiMo/MiMo-V2.6-Pro-RL(建立於 UTC 15:39:33)。兩者皆未設有閘門限制。兩者都附有一份技術報告與一張模型卡,而小米將兩者描述為單一混合強化學習訓練的產物,該次訓練將程式編寫、通用代理、視覺與資安任務納入同一次訓練,而非各領域分開訓練。
• 參數 — MiMo-V2.6-Flash:總計 309B,每個 token 啟動 15B。MiMo-V2.6-Pro:總計 1.02T,啟動 42B。兩者皆為稀疏混合專家模型。
• Backbone — Flash 有 48 層,39 層滑動視窗與 9 層完整注意力,隱藏大小為 4096,256 個路由專家且啟用 8 個,128 個詞元的滑動視窗,且沒有共享專家。Pro 則以更大的寬度運行相同的混合注意力構想。
• 模態——兩者皆為原生全模態,將文字、圖像、影片與音訊輸入同一個模型,而非三條硬湊在一起的管線。Flash 搭載 6.81 億參數的視覺 Transformer、3.08 億參數的音訊分詞器,以及 1.27 億參數的音訊 patch 編碼器。
• 上下文 — 100 萬個 token,兩者皆如此宣稱,且有設定檔支援 1,048,576 個 token 的最大位置嵌入。
• 授權條款 — 兩者皆為 MIT,沒有營收門檻,除了常見者之外沒有可接受使用限制,也沒有研究條款。商業部署、修改與再散布均獲允許。
• 權重檔案 —— Flash 以 65 個分片發布 172.9 GB 的 FP8 權重資料。Pro 的參數量約為其三倍,因此在你自行進行任何量化之前,其下載量就已落在半 TB 的範圍內。
• 它們的服務位置——Hugging Face、小米自家的 API 平台、AI Studio、MiMo Code 與 MiMo 桌面應用程式。該卡片指出,目前這兩個檢查點皆未由第三方推論供應商部署於 Hub 本身。
讓人損失硬體的碰撞
這個配對中的混淆其實並不是在 Flash 與 Pro 之間,而是在 MiMo-V2.6-Flash 與它之前的模型之間。
MiMo-V2-Flash 於 2025 年 12 月發布,而小米自家宣布它的部落格文章描述了一個專家混合模型,總參數達 3,090 億、活躍參數 150 億,採用交錯滑動視窗與完整注意力的混合注意力機制,以及激進的 128 詞元滑動視窗。把這對照上方的項目清單來看。2026 年的檢查點與 2025 年的檢查點有著相同的整體樣貌、相同的滑動視窗大小,以及相同的啟用預算——相隔九個月,來自不同的訓練執行,具備不同的能力與不同的基準測試表。
所以搜尋「MiMo V2.6 Flash」時,它會很樂意丟給你一堆關於 MiMo-V2-Flash 的頁面,還附上 256K 的上下文數字,以及每百萬輸入 token 只要十分之一美元的價格——而這些都屬於舊版模型。如果你正在估算節點規格,這可不是什麼無傷大雅的錯誤。舊的檢查點和新的檢查點是不同的下載項目,搭載不同的服務配置,而且新版聲稱擁有四倍的上下文。
命名裡還藏著第二個更隱晦的陷阱。這兩個儲存庫都以 -RL 結尾,讀起來像是架在某個其他基礎模型之上的強化學習適配器。它們並不是適配器。這個後綴標記的是後訓練的血統:它們是從串流式 RL 訓練中產出的完整檢查點。權重索引證實了這一點——數以萬計的張量,涵蓋了整個主幹、視覺編碼器、音訊堆疊,以及推測式草擬器。
廠商自己的表格怎麼說
本節中的每一個數字,都來自小米在兩份模型卡中的評測表格。小米是在自家檢查點上執行這些測試框架的。這些結果沒有任何一項在實驗室之外被重現過,也沒有一項出現在公開排行榜上,而比較欄位是該廠商自己用同一批測試框架對其他公司模型所做的執行結果。請把這份排名當作參考資訊,把小數位數當作裝飾即可。
• 程式碼代理 — DeepSWE v1.1:Flash 67.9,Pro 71.9。Terminal Bench 2.1:Flash 87.6,Pro 89.9。ProgramBench:Flash 26.0。MiMo Code Bench:Flash 61.2。
• 通用代理 — AutomationBench v1.0.6:Flash 52.3,Pro 53.1。Toolathlon-Verified:Flash 73.6,Pro 76.9。OSWorld-Verified:Flash 80.8,Pro 82.0。Agents' Last Exam:Flash 27.6。Terminal Bench 4.0:Flash 28.8。
• 網路安全 — 較小模型唯一領先的欄位。CyberGym:Flash 95.1,對比 Pro 的 94.0。MiMo Cyber Bench:Flash 77.2。接著表現急轉直下:ExploitGym 6.0、ExploitBench 25.3、SEC Bench Pro 47.5。
• 視覺代理 — MiMo VisualCoding:Flash 71.5,Pro 72.3。
讀完那些項目符號後,誠實的總結是:Pro 幾乎在各處都領先,但幅度很小,而這些幅度小到足以落在自行運行測試框架的雜訊範圍內。在 DeepSWE 上,兩者相差四分,而在這個量表上,同一個檢查點在 Xiaomi 自家的兩次評估之間就移動了兩分。
最後那一點值得獨立成一段,因為它是這兩張卡當中最有用的資訊。小米公開的 RL 儀表板,整個九月都直播了這兩次訓練,公布 Flash 在 65.68 分,測試項目為 DeepSWE v1.1、使用 mini-swe-agent 測試框架、取三次平均。最終完成的卡片則為正式發布的權重印出 67.9,這是針對正式發布權重的成績。與此同時,Pro 的儀表板數字是 72.57,而它的卡片印出 71.9——它反而下降了。同一次訓練的兩個檢查點,各被評估了兩次,而兩次評估之間的落差,竟和兩個模型之間的落差一樣大。如果你自上週以來一直在引用儀表板上的數字,那些數字描述的是訓練快照,而不是你今天會下載到的成品。

兩者都不在路由器上
這正是決定大多數實際評估的關鍵部分。小米並未販售這兩個檢查點中的任何一個:其自家網站上沒有公布 MiMo-V2.6 世代的每 token 價格,也沒有為其中任何一個發布可呼叫的模型識別碼。取而代之的是一個下載檔,外加——僅限 Pro——一家 API 供應商,Artificial Analysis 認定其以每百萬輸入 token 0.435 美元、每百萬輸出 token 0.87 美元的價格提供服務。那是供應商的刊載價格,而非原廠價目表,而 Flash 則完全沒有可相比的資訊。在第三方型錄頁面上流傳的數字,也應以同樣方式解讀。
所以,Flash 與 Pro 之間的選擇,並不是在兩個計量方式不同的端點之間做選擇。它是在兩筆 GPU 帳單之間做選擇,而金額較小的那筆大約是較大那筆的三分之一。這就是 Flash 的全部商業論據,而且它比基準測試表所暗示的更有力,因為在大多數人購買時所著眼的任務上,這兩個模型只相差幾分。
這樣一來,剩下的就是那熟悉的三方格局。租用前沿模型、自擁小型模型,或自擁大型模型。前沿模型這一欄,正是小米在自家表格中拿來對比的對象——在供應商自家的比較中,Claude Opus 5、GPT-5.6 Sol 與 Claude Fable 5 在 DeepSWE 上都比 Pro 高出幾分,而這三款現在都能透過OrcaRouter 上的一組 API 金鑰,以供應商表定價格、0% 加價直接轉嫁的方式呼叫。這對你眼前這個具體決策很重要:供應商調價會當天就落到你這邊,而不是等到下一次合約續約,因此隨著託管價格變動,租用與自擁的盤算才能保持誠實。自動容錯移轉也意味著,你仍在評估的模型永遠不必獨自承擔正式環境路徑,讓你在做決定期間更安心。
今天在任何路由器上——包括我們的在內——都辦不到的事,就是呼叫 MiMo-V2.6-Flash 或 MiMo-V2.6-Pro。我們不路由任何小米模型,而小米自家卡片上的可用性說明指向小米自家的管道:MiMo API 平台、AI Studio、MiMo Code 和桌面應用程式。
哪個檢查點,以及何時
如果你要的是 MiMo-V2.6 這一代,而硬體才是真正的限制條件,那就選 MiMo-V2.6-Flash。相較於旗艦款,你得放棄大約四點 DeepSWE 分數,以及在多數 agent 基準測試上的一到兩分。你換來的是一份記憶體需求約只有三分之一的 checkpoint,它在小米自家表格中的 CyberGym 上領先 Pro,而且共享同樣的授權、同樣的 1M token 脈絡宣稱,以及同樣的多模態能力。對一支做資安評估工作的團隊來說,CyberGym 那一欄可不是可以四捨五入忽略的誤差。
如果工作負載是程式編寫或長時程的代理式工作,而且節點已經付費,就選 MiMo-V2.6-Pro。它在幾乎每一欄都是更好的模型,也是 Artificial Analysis 實際測量過的那一個——在重新校準的 v4.3 量表上,智慧指數為 46,在其開放權重類別的 114 個模型中排名第一,輸出速度為每秒 134.3 個詞元,並標價為每百萬輸入詞元 $0.435、每百萬輸出詞元 $0.87——而當你在規劃正式生產環境時,獨立測量比供應商的表格更有價值。
在讀過設定檔本身、而非摘要之前,兩者都先別信。Flash 的模型卡描述了一個五層的推測式草稿模型,每次預測七個 token;但同一個儲存庫中的 config.json 卻把 num_nextn_predict_layers設為 3。模型卡的摘要並不是執行時實際讀取的內容。而且儲存庫頁面上的 Safetensors 區塊顯示 Flash 有 159B 個參數、Pro 有 524B 個參數,這兩者都與兩份模型卡裡的總參數數或啟用參數數對不上。小米並未解釋這項落差。請改以已發布的權重資料來判斷規模,因為無論參數怎麼計算,那才是你在 VRAM 中實際要付出的數字。

什麼能解決這件事?
三件事,大致按用處高低排序。由第三方在相同的評測框架上跑一次——DeepSWE 或 Terminal Bench,以提交結果而非自行回報的方式——就能告訴你 Flash 與 Pro 之間那四分的差距,究竟是真實的位階,還是有利的組態設定。一份公開的價目表,則會讓整個比較從一項硬體專案,變成一個可以放在代管前沿服務旁邊的單項項目。而 RL 環境——小米已表示將會開源——才是大多數團隊實際上最想要的產物,因為你需要它們才能在你自己的追蹤資料上重現這個迴圈。
在那之前,實際的解讀空間很有限。MiMo-V2.6 是兩個檢查點,而不是一個,而單稱這個名字時,通常指的是較昂貴的那一個。如果你今天要在這個系列裡做選擇,誠實的預設答案是 Flash,除非你特別在意的那個基準測試欄位顯示並非如此——而如果你還沒準備好買節點,那兩者目前都還不是正確答案。

