一張用於 Xiaomi MiMo-V2.6-Pro 與 MiniMax M3 比較的標題卡,展示兩張面對面的規格卡:Xiaomi MiMo-V2.6-Pro 在 Intelligence Index v4.3.2 為 46、輸出速度為每秒 134.3 個 token、混合價格為每 1M $0.18,以及 1 家 API 供應商;對比 MiniMax M3 的 Index 為 29、每秒 168.9 個 token、$0.22,以及 15 家 API 供應商。
Guides & Insights

Xiaomi MiMo-V2.6-Pro 對比 MiniMax M3:分數更高,路線更精簡

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

小米 MiMo-V2.6-Pro 於 2026 年 9 月 22 日正式全面開放,並在 v4.3.2 的 Artificial Analysis Intelligence Index 上以 46 分登上開源權重模型榜首。MiniMax M3 自 2026 年 5 月 31 日推出以來,一直保有該頭銜的某個版本,而如今在同一個指數上得分為 29——落後 17 分。分數是這對組合中最不有趣的東西。MiniMax M3 的輸出速度為每秒 168.9 個 token,對比之下為 134.3;回應時間為 0.92 秒,對比之下為 2.15 秒;每輸入 token 更便宜;且可透過十五家 API 供應商取用,而小米僅有一家。較新、得分較高的模型,實際上反而更難呼叫,而這種反轉正是本次比較的重點。

兩者皆為開放權重,兩者皆為多模態,相隔十四週。

這兩個模型在設計理念上是近親。兩者都是來自中國實驗室的稀疏混合專家模型,都具備 100 萬 token 的上下文視窗,都原生支援圖像與影片,而非透過外掛式適配器,且兩者都公開權重。兩者的發布時間相隔十四週,而它們之間的指數差距,正是開放權重前沿在那段期間所推進的距離。

• 總參數量 — Xiaomi MiMo-V2.6-Pro 1.02T;MiniMax M3 約 427B,兩者皆為稀疏 MoE

• 每個 token 的啟用參數 — Xiaomi MiMo-V2.6-Pro 42B;MiniMax M3 約 23–25B

• 上下文 — 各 1M tokens,MiniMax M3 保證至少 512K

• 輸入模態 — 兩者皆支援文字、圖像和影片;Xiaomi 新增音訊輸入

• 權重 — Xiaomi MiMo-V2.6-Pro 採用 MIT 授權;MiniMax M3 以 MiniMax 社群授權條款發布,該授權並非寬鬆式授權,商業用途需另行簽訂協議

• 已發布 — Xiaomi MiMo-V2.6-Pro 2026年9月21–22日;MiniMax M3 2026年5月31日

• 可及性 — 在 Artificial Analysis 上,Xiaomi MiMo-V2.6-Pro 計有 1 家 API 供應商;MiniMax M3 則計有 15 家

最後那一行才是該持續留意的重點。表單上其餘每一項都偏向較新的模型。那一行卻不然,而正是那一行決定了一個模型能否進入正式生產路徑。

該指數衡量什麼,以及是誰測量的

Artificial Analysis 自行在 v4.3.2 上跑了這兩個模型——那是一項涵蓋推理、知識、數學與程式設計的十項評測綜合指標,包含 AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience 與 AA-LCR v1.1。46 和 29 這兩個數字都不是廠商數據,這點在這裡很重要,因為兩家實驗室也都發表了自家的基準測試數據,而那是廠商數字,這兩種數字絕不能混為一談。

46 分讓小米 MiMo-V2.6-Pro 在該綜合指標上位居開放權重領域之首。但這並沒有讓它登上該指數的榜首:Claude Fable 5.1GPT-6 Astra 同為 53 分,Claude Opus 5 則是 51 分。MiniMax M3 的 29 分使其在 114 個受測模型中排名第十六,遠高於同尺寸級別的中位數,但距離六月時被拿來與之比較的前沿仍相去甚遠。

MiniMax M3 握有小米所沒有的實據

這是比較中常被略過的部分,也是買方最應該重視的部分。MiniMax M3 以官方條目登上公開的 DeepSWE v1.1 排行榜:20.4% Pass@1 與 48.7% Pass@4,在 MiniMax 推論升級修正了異常 token 生成並改善了長上下文快取行為後,於 2026 年 6 月 8 日發布。該條目附帶了一份效率核算,而這份核算並不怎麼好看:中位數 311 個代理步驟、約 91,000 個輸出 token,以及每項任務約 $5.04。它能通過長時程工程任務,但代價高昂。

Xiaomi 為其新模型公佈的頭條基準測試分數,是在 DeepSWE v1.1 上得到 72.57,高於 58.4 的基準線,以 mini-swe-agent 在 Xiaomi 自家測試框架上取三次平均測得。它並非排行榜上的條目,也未曾以排行榜條目身分提交。把 72.57 與 MiniMax 的 20.4 並列,並從中讀出 52 分的勝利,這是跨兩種不同測量的算術:排行榜針對特定配置公佈 Pass@1,附有信賴區間以及可供第三方重跑的每項任務平均成本;而廠商數字完全沒有這些附加資訊。72.57 很可能確實是誠實的。它只是並非同一類事物。

MiniMax 也公布了自己的發布數據,而同樣的但書適用於每一項:SWE-Bench Pro 為 59.0、BrowseComp 為 83.5、SVG-Bench 為 63.7,以及 Terminal-Bench 2.1 為 66.0,這些都是在 MiniMax 自家基礎設施上、以自家測試框架運行得出的。請把它們視為對該模型的宣稱,而不是對它的實測結果。

速度、延遲,以及決定帳單的兩個數字

吞吐量差距與品質差距方向相反,而且差距大到足以造成影響。MiniMax M3 每秒產生 168.9 個輸出 token,Xiaomi MiMo-V2.6-Pro 則為 134.3 個;其首個 token 的 0.92 秒,比 Xiaomi 的 2.15 秒快上約兩倍半。對互動式產品而言,首個 token 延遲是使用者切身感受到的數字;對批次處理管線而言,吞吐量則是決定實際耗時(wall clock)的數字。

在成本方面,兩者比表面費率所顯示的更接近,而方向取決於你的流量。MiniMax M3 的標價是每百萬輸入 token $0.30、每百萬輸出 $1.20;Xiaomi MiMo-V2.6-Pro 的標價則是 $0.43 和 $0.87。M3 的輸入成本較低,Xiaomi 的生成成本較低。一旦套用快取折扣——M3 為 80%,Xiaomi 為 99%——在 7:2:1 的快取命中/輸入/輸出組合下,混合費率分別為每百萬 $0.22 和 $0.18。Artificial Analysis 也記錄了 Xiaomi MiMo-V2.6-Pro 每項 Intelligence Index 任務 $0.13 的成本,且是以相同方式對排行榜上每個模型進行測量,這是兩者之間可取得、最具可比性的單一成本數字。

A two-column comparison scoreboard for Xiaomi MiMo-V2.6-Pro and MiniMax M3 covering Intelligence Index v4.3.2 (46 vs 29), output speed (134.3 vs 168.9 tokens/second), time to first token (2.15s vs 0.92s), blended rate ($0.18 vs $0.22 per 1M), API providers (1 vs 15) and long-horizon evidence (vendor harness only vs public Pass@1 entry).

十五條路由對抗一條,以及容錯移轉有何價值

十七點的指數優勢,在端點故障時也幫不了你。撰寫本文時,Artificial Analysis 只統計到一家 API 供應商提供 Xiaomi MiMo-V2.6-Pro,而這個數字是關於這次發布的事實,而非關於模型本身:三天前才發布的檢查點根本還沒有時間傳播開來。已問世四個月的 MiniMax M3,則有十五家供應商提供服務。

這個差異正是路由器存在的意義,也是這兩款模型在商業上分道揚鑣之處。 MiniMax M3 在 OrcaRouter 上以 minimax/minimax-m3: 單一 OpenAI 相容端點的形式提供,供應商定價原價直通、零加成,因此上述的 $0.30 與 $1.20 是 MiniMax 自家的數字,而非我們的,而 MiniMax 一旦調整價格,我們這邊當天就會同步生效。它的十五家上游供應商,正是讓自動容錯移轉鏈有意義的關鍵——某個供應商上的請求若卡住,會在回應開始前改重試到另一家,這與只有一個去處的模型所能提供的保證截然不同。Xiaomi MiMo-V2.6-Pro 不在 OrcaRouter 上;小米沒有任何模型在上面,如今要用它,只能透過小米自家平台以及列出它的第三方目錄。

如果你想在同一個應用程式裡同時擁有兩者,實務上的做法是:用一把金鑰容納你已經決定採用的模型,讓新加入的模型對照這些模型接受評估,而不是光憑一個三天前的分數就予以採用。這是一項路由決策,而它有用的特性在於:備援路徑在你需要它救命的那一天到來之前,不會有任何成本。

The OrcaRouter model page for minimax/minimax-m3, showing MiniMax as the vendor, the 2026-05-31 release date, Vision, Tools, JSON and Reasoning capability tags, a 1M-token context window, 512K maximum output, $0.30 per 1M input and $1.20 per 1M output, and a p50 time to first token of 8.49 seconds.

該選哪一個

如果你本週就要在生產環境中使用一個權重開放、多模態、具備百萬 token 的模型,答案就是 MiniMax M3,而且勝負毫無懸念——十五家供應商、首 token 亞秒級、只有在讀過社群授權條款後才稱得上夠寬鬆的商業使用路徑,以及可供你檢視的官方長時程基準測試成績。效率警告是真的:要為每項任務的 91,000 個輸出 token 編列預算,而不只是看每 token 的費率。

如果你正在為下個月要開始的工作挑選模型,Xiaomi MiMo-V2.6-Pro 是能力更強的模型,而且經過實測的差距很大,混合費率更低,還採用 MIT 授權,完全省去授權方面的討論。它目前還沒有的,是第二個可運行的地方。值得留意的是供應商數量:當它從只有一家增加時,那十七個百分點的差距就不再是研究結果,而會成為部署決策。

在那之前,誠實的總結是:較好的模型是你無法從它容錯移轉的模型,而較弱的模型是你今晚就能端到客戶面前的模型。

The Artificial Analysis model page showing the Intelligence Index v4.3.2 scores, output speed, latency and per-task cost that both models in this comparison are measured on.

這篇文章中的數字從何而來

兩個模型的索引分數、吞吐量、延遲、快取折扣與供應商數量,都是 Artificial Analysis 在 Intelligence Index v4.3.2 上的測量結果,讀取於 2026 年 9 月 22 日;MiniMax M3 的 29 分與 Xiaomi MiMo-V2.6-Pro 的 46 分,位於同一版綜合指標上。MiniMax M3 的 DeepSWE v1.1 數據,來自 2026 年 6 月 8 日的公開排行榜條目。DeepSWE 從 58.4 到 72.57 的變化、Pro 執行在三十個步驟中約 262 萬美元的強化學習支出,以及 MiniMax M3 的 SWE-Bench Pro、BrowseComp、SVG-Bench 與 Terminal-Bench 數字,全都是廠商在各自實驗室自有測試框架上報告,尚未經獨立重現。每 token 費率是廠商自己的定價表價格。