
MiMo-V2.6-Pro 對比 MiMo-V2.6-Flash:兩項基準測試也解釋不了的 3 倍價差
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
在 Xiaomi 自家的評測表中,MiMo-V2.6-Flash 勝過 MiMo-V2.6-Pro。該項目是 CyberGym,差距為 95.1 對 94.0。這只是十五個項目中的其中一項,而這正是應該仔細閱讀這份比較其餘內容、而非理所當然認為旗艦款永遠是解答的原因——因為 MiMo-V2.6-Flash 的成本大約是 MiMo-V2.6-Pro 的三分之一,而且在大多數項目上,兩者的差距僅在幾分以內。
兩款模型皆於 2026 年 9 月 21 日以 Hugging Face 儲存庫形式發布,採用 MIT 授權,發布時間相隔十八秒,屬於各自獨立的訓練執行,而非同一座階梯上的不同階級。Xiaomi MiMo-V2.6-Pro 是兆級參數層級。MiMo-V2.6-Flash 是效率層級。本頁要回答的問題是:兩者之中哪一款適合放進你的正式生產路徑;而誠實的答案取決於一個在兩份發布中都找不到的數字。
每一項是什麼
• 參數 — Xiaomi MiMo-V2.6-Pro 總計 1.02T,每個 token 啟用 42B,對比 Xiaomi MiMo-V2.6-Flash 總計約 309B、啟用 15B
• 架構 — 兩者皆為稀疏混合專家模型,原生支援全模態輸入;Flash 的官方文件記載為 48 層,其中 39 層滑動視窗注意力、9 層全注意力,隱藏層大小 4096,256 個路由專家、啟用 8 個且無共享專家,另搭配 681M 視覺 Transformer、308M 音訊分詞器與 127M 音訊區塊編碼器
• 上下文 — 兩者皆為 1M tokens,輸出上限皆為 128,000 tokens
• 授權 — 兩者皆為 MIT,權重皆無需申請即可取得
• 價格 — Pro 為每百萬 tokens 輸入 $0.435、輸出 $0.87,Flash 則為 $0.14 與 $0.28:卡片兩側皆相差 3.1 倍
• 快取命中輸入 — Pro 為每百萬 $0.0036,Flash 為 $0.0028
• 訓練支出 — Xiaomi 回報 Pro 的強化學習訓練運行約花費 $2.62M,Flash 為 $854K,兩者皆在不到六天內完成,歷經 30 個強化學習步驟與約 750,000 條軌跡
• 獨立指數評分 — Xiaomi MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index v4.3.2 上為 46;MiMo-V2.6-Flash 則未公布任何分數
最後那行才是該牢牢記住的。除了 Pro 分數之外,上面所有內容都是小米官方提供的數據。
當價格變成三倍,卻幾乎什麼都買不到
Xiaomi 的表 3 將兩者在該系列訓練時所用的各項測試框架上並列對照,而在長時程代理式工作上,差距甚微:
• DeepSWE v1.1 — Pro 71.9、Flash 67.9
• MiMo Code Bench — Pro 63.2、Flash 61.2
• AutomationBench v1.0.6 — Pro 53.1、Flash 52.3
• Toolathlon-Verified — Pro 76.9、Flash 73.6
• Terminal Bench 2.1 — Pro 89.9、Flash 87.6
• OSWorld-Verified — Pro 82.0、Flash 80.8
• JobBench — Pro 62.0、Flash 61.2
• MiMo Visual Coding — Pro 72.3、Flash 71.5
• CyberGym — Pro 94.0、Flash 95.1
• MiMo Cyber Bench — Pro 80.2、Flash 77.2
往下讀那一欄,旗艦機的優勢大多落在一到四分之間,還有一列徹底落敗。在某些工作流程裡,67.9 與 71.9 之間的差距,就是任務完成與任務失敗之間的差別,那麼三倍的價格算是便宜。但在另一種工作流程裡,若這只是兩個都可接受的答案之間的差異,那就不值得了。像這樣小數點落得鉅細靡遺的廠商數據表,容易讓人誤以為精確——小米以外沒有人實際跑過這些數據,而在內部自行評分的測試框架上,兩分的差距,完全落在換個評分者或換套重試策略就能造成的變動範圍之內。

它在哪裡大量購買
有一群列,其中的差距已不再只是四捨五入的爭議。這些每一項都是安全性相關的工作:
• ExploitGym — Pro 17.8、Flash 6.0
• ExploitBench — Pro 47.9、Flash 25.3
• SEC Bench Pro — Pro 66.3、Flash 47.5
• Agents' Last Exam — Pro 31.6、Flash 27.6
• Terminal Bench 4.0 — Pro 34.9、Flash 28.8
在 ExploitGym 上,旗艦模型的表現是較便宜模型的三倍,這與價格的倍數相同;而在 SEC Bench Pro 上則是 1.4 倍。這種模式正是你預期會從一個擁有 420 億活躍參數的模型對上一個擁有 150 億活躍參數的模型身上看到的:一項需要長鏈推理且沒有部分分數的任務,正是額外容量會顯現出來的那種任務,而 CyberGym 的結果落在另一邊,則是那個例外,證明這兩次訓練學到的是不同的東西,而不是同一件事在不同規模下的表現。
所以這個切分對應的是真實的工作負載界線,而不是行銷上的界線。成功標準寬鬆的高吞吐量代理工作——檢索、分類、例行性編輯、可透過重試挽救的呼叫——屬於 Flash 的領域。錯誤答案代價高昂、不完整答案毫無價值的工作——漏洞利用開發、安全審查、具備多步驟狀態的終端機工作階段——才是 Pro 等級賺得那個倍數價差的地方。
不存在的數字
MiMo-V2.6-Flash 沒有 Artificial Analysis 模型頁面。它的同系列版本有。這種不對稱是這一頁最重要的一件事,因為這意味著 MiMo-V2.6 系列中唯一經過獨立測量的數字,就是 Xiaomi MiMo-V2.6-Pro 旁邊的那個 46。上方每一個 Flash 數字——包括它勝出的 CyberGym 那一行——都來自 Xiaomi 的測試框架、Xiaomi 的評分器和 Xiaomi 的離線執行。
有一個合理的論點認為這只是暫時的:在撰寫本文時,這個模型才問世一天,而第三方評測需要時間。也有一個合理的論點認為這是結構性的,因為 Flash 是走量級別,而走量級別較少受到評測關注。無論如何,今日的實際後果是:你無法以比較 Pro 時那種同樣的信心,拿 Flash 與其家族以外的任何東西相比。如果你正基於性價比在 Flash 與非小米機型之間做選擇,那你是在拿廠商公布的數字去比別人實測出來的數字。
兩張模型卡都帶有相同的第二項但書。這兩個儲存庫都沒有被任何推論供應商部署——Hugging Face 在每個頁面上都明確這麼說,而 Artificial Analysis 針對 Pro 只計到一家 API 供應商。我們並未託管任何一個 checkpoint,因此兩者都無法透過我們路由。通往兩者的途徑是 Xiaomi 自家的平台,以及收錄它們的第三方目錄。

你付出的是硬體代價,而非代幣
每個 token 的定價只是 checkpoint 成本的一半,而這兩者在磁碟上的差距遠比價目表上更為懸殊。MiMo-V2.6-Flash 發佈了 172.9 GB 的 FP8 權重,分散於 65 個分片。Xiaomi MiMo-V2.6-Pro 的參數量約為其三倍,這使其在未經任何量化前的原始下載量落在半 TB 級別——而它自己的儲存庫回報 Safetensors 模型大小為 524B 參數,這個數字既不符合 1.02T 的總量,也不符合 42B 的活躍參數數量。
那道差距改變了這項決策的形態。172.9 GB 的 Flash 是一款小型團隊能在租用算力上自行託管,並把它當作一般商品看待的模型。大約是前者三倍的 Pro 則是一項叢集級決策——發布期間的報導指出,這兩次訓練分別約使用 4,000 與 8,000 顆 H200 等效 GPU。如果你考慮開放權重的原因是想要有不再按 token 付費的選項,那麼這兩個檢查點提供這個選項,但所需投入的規模截然不同。
從中選擇
在上述但書之後仍成立的法則是:依工作負載類別來選擇,而不是依基準測試平均分數來選擇。凡是你能安心重試的,就用 Flash;凡是重試也救不了你的,就用 Pro。接著要實際測量,因為在你真正在乎的基準測試上,這兩個模型都沒有獨立分數。
把兩個檢查點並排衡量,正是路由器能做、而單一模型合約做不到的事。把便宜的層級用在你的大部分流量上,只把困難的案例升級到昂貴的那一層,這就是與本頁相同的決策,只是以設定而非改寫的形式表達——而這樣的組合正是路由層存在的意義。這對價格本身也同樣重要:我們以 0% 加成,將供應商的定價原樣轉給您,因此若小米調降任一個檢查點的費率,我們這邊的數字當天就會跟著變動,而不是等到下一次合約續約。這適用於我們所提供的模型。就 MiMo-V2.6 這兩個模型而言,目前您仍是直接向小米購買。
什麼能解決這件事?
有兩件事能讓這件事從主觀判斷變成一道算術題。若有一頁 MiMo-V2.6-Flash 的 Artificial Analysis 頁面,就能把兩個檢查點放在同一條每任務成本軸上——目前該軸把 Pro 列為每個 Intelligence Index 任務 $0.133——比較自然就會有答案。由第三方重現這個安全測試群組——ExploitGym、ExploitBench、SEC Bench Pro——就能確認那些列上的 3 倍差距是模型本身的特性,還是評分器的特性。
在此之前,站得住腳的立場是:對大多數團隊在大多數時候而言,Xiaomi MiMo-V2.6-Flash 是更划算的選擇;而對於失敗會造成高昂代價的那一狹窄類型工作,Xiaomi MiMo-V2.6-Pro 才是更划算的選擇。Flash 勝出的那一列並不會推翻這點——但它是有用的提醒:旗艦產品的溢價,是針對某種工作負載的主張,而不是針對某個模型的主張。

