
MiMo-V2.6-Pro 對比 GLM-5.2:兩款開放權重 MoE,以及那個你絕不能減去的基準測試
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
這個比較最偷懶的版本,是把 Xiaomi MiMo-V2.6-Pro 的 72.57 擺在 GLM-5.2 的 46.2 旁邊,稱之為 26 分的勝利,然後就發表了。它錯的原因與哪個模型更好無關:這兩個數字不是同一種測量。小米的 72.57 是在自家測試框架上、搭配 mini-swe-agent 的三次平均,從未提交到任何公開排行榜;而 46.2 則是來自完全不同測試框架的 Pass@1 數字。Xiaomi MiMo-V2.6-Pro 與 GLM-5.2 之間誠實的比較是另一回事,是在兩者都實際被拿來跑過的同一把尺上——而在那把尺上,差距確實存在,但它是十二分,不是二十六分。
在 2026 年 9 月 22 日讀取的 Artificial Analysis Intelligence Index v4.3.2 上,Xiaomi MiMo-V2.6-Pro 得分 46。GLM-5.2 得分 34。兩者都是來自中國實驗室的開放權重混合專家模型,兩者都支援 100 萬 token 的上下文視窗,而且兩者定價都夠便宜,因此兩者之間的選擇取決於能力與服務,而非預算。相似之處僅止於此,因為 GLM-5.2 已被其自家開發商取代,而這篇比較文章所在的頁面也帶有棄用通知。
每個模型是什麼,以及它處於什麼狀態
GLM-5.2 是 Z.ai 的旗艦模型,於 2026 年 6 月 16 日發布。它是一個專家混合式 Transformer,總參數約為 7530 億,每個詞元約有 400 億活躍參數;據報導,它完全以華為昇騰加速器訓練,而非 Nvidia 硬體。它以 MIT 授權條款釋出開放權重,提供 FP8 與 INT4 量化,支援 100 萬詞元的上下文,輸出最高可達 131,072 個詞元,並在 Z.ai 自家 API 上定價為每百萬輸入詞元 1.40 美元、每百萬輸出詞元 4.40 美元,快取輸入為 0.26 美元,混合費率為 0.90 美元。Artificial Analysis 測得其輸出速度為每秒 72.6 個詞元,首個詞元耗時 5.98 秒,執行完整索引的成本為 1,559.05 美元。
小米 MiMo-V2.6-Pro 於 2026 年 9 月 22 日正式全面開放,其強化學習檢查點儲存庫則在前一天出現。這是一個稀疏混合專家模型,總參數達 1.02 兆,每個詞元啟用 420 億參數——總量比 GLM-5.2 更大,啟用數量則幾乎相同——具備 100 萬詞元上下文視窗、原生支援文字、圖像、視訊與音訊的多模態能力,以及 MIT 授權的權重。小米維持了前一代的定價,而非向上調價,因此其定價為每百萬詞元 0.43 美元與 0.87 美元,享有 99% 快取折扣,混合價為 0.18 美元。
• 權重 — 兩者皆以 MIT 授權且可下載;這是唯一一個兩者真正平等的類別
• 活躍參數 — MiMo-V2.6-Pro 每個 token 42B;GLM-5.2 約 40B。兩者幾乎完全相同,這使得分數差距是訓練的結果,而非規模的結果
• 總參數量 — MiMo-V2.6-Pro 1.02T;GLM-5.2 約 753B
• 指數分數 — MiMo-V2.6-Pro 46;GLM-5.2 34,兩者均於 Artificial Analysis v4.3.2 上
• 定價 — MiMo-V2.6-Pro 每 1M 為 $0.43 / $0.87;GLM-5.2 為 $1.40 / $4.40,混合價格 $0.18 對比 $0.90
• 執行索引的成本 — MiMo-V2.6-Pro $206.66;GLM-5.2 $1,559.05
• 速度 — MiMo-V2.6-Pro 134.3 輸出 token/秒;GLM-5.2 72.6
• 首個 Token 時間 — MiMo-V2.6-Pro 2.15 秒;GLM-5.2 5.98 秒
• 狀態 — MiMo-V2.6-Pro 為現行版本且已 GA;GLM-5.2 已在 Artificial Analysis 上被棄用,該平台現在僅以預設的 10k 輸入工作負載對其進行基準測試

棄用通知是頭條
Z.ai 其後已推出 GLM-5.3,而 Artificial Analysis 的 GLM-5.2 頁面也直接這麼寫,將該模型標記為已淘汰,並把後續的基準測試工作縮限在單一預設工作負載上。這改變了本頁的用途。如果你今天要挑選新模型,你真正在意的對決是 MiMo-V2.6-Pro 對上 GLM-5.3,而不是 GLM-5.2——而且在同一個 v4.3.2 索引上,以最高投入程度運行的 GLM-5.3 得分 45,MiMo-V2.6-Pro 則是 46。一分之差。那是一場真正的廝殺,也完全是另一篇文章。
GLM-5.2 的比較仍然值得做,原因很具體:這是最低成本的方式,能說明開放權重前沿在 2026 年 6 月到 9 月之間移動得有多快。大約十四週內上升十二個指數點,而活躍參數量基本上維持不變。無論是什麼帶來了那項進展,都不是規模。
GLM-5.2 過去擅長什麼,以及它如今是否依然如此
GLM-5.2 的發表資料主打程式編寫與長時間執行的代理式工作,而那些數字至今仍足以描述這款模型:SWE-bench Pro 為 62.1,GLM-5.1 則是 58.4;Terminal-Bench 2.1 為 81.0,對手是 63.5;FrontierSWE 為 74.4,對手是 30.5。在知識與數學方面,它回報 GPQA-Diamond 為 91.2、AIME 2026 為 99.2,以及 Humanity's Last Exam 為 40.5。當時它在一項長時程代理式程式編寫基準上領先所有模型,並在一份公開的網頁開發排行榜上排名第二。這些都是廠商在其自家測試框架上回報的數字,而每一項都適用那套老生常談的但書。
Xiaomi 自己公佈的 MiMo-V2.6-Pro 數字,不能與它們相提並論,而值得精確說明原因,而不是含糊帶過。Xiaomi 報告,該模型在其強化學習訓練過程中,於 DeepSWE v1.1 上從 58.4 提升到 72.57,使用 mini-swe-agent 以三次平均進行評估,並由自家評分器評分;該次訓練記錄為 30 個步驟,在不到六天內完成約 750,000 條軌跡,公佈的 Pro 模型花費約為 262 萬美元。這些都不是排行榜條目。排行榜條目是對特定配置在明確條件下的一種主張,且第三方能夠重新執行,而 Xiaomi 的並非如此。另一個追蹤器將 GLM-5.2 列為在 DeepSWE 上 46.2——Pass@1,這是同一任務家族中的不同指標——而將 72.57 與 46.2 並列以得出 26 點差距,是在兩種不同尺度上做算術。不應該這麼做,而這是關於這一對最常見的流傳錯誤。

在兩者之間做選擇,以及讓它變便宜的路由
如果兩者都是同一授權下的開放權重,決定因素就是你實際能跑什麼,以及能在哪裡呼叫它。GLM-5.2 已在 OrcaRouter 上,代號為 z-ai/glm-5.2——單一 OpenAI 相容端點,供應商定價原樣傳遞、0% 加價,因此 Z.ai 調價當天,我們這邊即同步生效。小米 MiMo-V2.6-Pro 不在 OrcaRouter 上;小米旗下沒有任何模型在我們這裡,要取用它得透過小米自家平台,或是有收錄它的第三方型錄。我們寧可把這點講明白,也不願讓模型頁面暗示相反的情況。
有用的結果是,你可以用單一金鑰維持現有供應商,並在不需要第二份合約的情況下,以它們為基準來評估新進者。如果 MiMo-V2.6-Pro 在你的提示詞上勝出,你已用很低的成本得知這件事。如果它沒有勝出——而且相較於每詞元價格差距之大,十二點的指數差距其實較小,因此結果確實取決於你的工作負載——你除了這次測試之外什麼都沒損失。將兩者以自動容錯移轉的方式配置在單一端點之後,也回應了針對本週才推出的模型所提出的實際疑慮:單一服務路由就是單點故障,而一條你能退回的備援通道,正是讓新模型可以安全置於真實流量之前的關鍵。

簡短的回答
如果你今天用的是 GLM-5.2,而且它運作正常,那麼升級的問題不在於 MiMo-V2.6-Pro——而是 GLM-5.3,同一個血脈,與小米模型只差一分,而且沒有任何遷移成本。如果你是從零開始挑選路線,想要三者中實測分數最佳的開放權重,那 MiMo-V2.6-Pro 的 46 就是那個數字,而它每秒 134.3 個 token 以及每項索引任務 0.13 美元,正是它不只是小勝的原因。如果你想要三者中最安全的選擇,GLM-5.2 是錯誤答案,原因與它在六月時有多好毫無關係:它是三者中唯一一個自家廠商已經停止開發的。
OrcaRouter 將 200+ 個模型置於單一 OpenAI 相容端點之後,以供應商標價提供且 0% 加成,因此供應商價格一有變動,當天即會生效。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
