
MiMo-V2.6-Pro 对比 GLM-5.2:两个开放权重 MoE,以及那个你绝不能忽视的基准测试
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
这种对比最偷懒的做法,就是把 Xiaomi MiMo-V2.6-Pro 的 72.57 和 GLM-5.2 的 46.2 摆在一起,称之为领先 26 分,然后直接发布。它错的原因与哪个模型更好毫无关系:这两个数字根本不是同一种测量。小米的 72.57 是在自家测试框架上用 mini-swe-agent 跑出的三次平均,从未提交到任何公开榜单;而 46.2 则是来自一个完全不同测试框架的 Pass@1 数值。对 Xiaomi MiMo-V2.6-Pro 和 GLM-5.2 进行诚实对比,应该是另一种方式,用两者真正都跑过的同一把尺子来衡量——而在那把尺子上,差距确实存在,但它是十二分,而不是二十六分。
在 2026 年 9 月 22 日读取的 Artificial Analysis Intelligence Index v4.3.2 上,Xiaomi MiMo-V2.6-Pro 得分为 46。GLM-5.2 得分为 34。两者都是来自中国实验室的开放权重混合专家模型,均运行 1M token 上下文窗口,而且两者定价都足够便宜,因此它们之间的选择关乎能力和服务,而非预算。相似之处到此为止,因为 GLM-5.2 已被其自家厂商取代,而这篇对比所在的页面带有弃用通知。
每个模型是什么,以及它处于什么状态
GLM-5.2 是 Z.ai 的旗舰模型,于 2026 年 6 月 16 日发布。它是一款混合专家(MoE)Transformer,总参数量约为 7530 亿,每个 token 激活约 400 亿参数;据报道,它完全基于华为昇腾加速器而非英伟达硬件训练。它以 MIT 许可证开放权重,并提供 FP8 和 INT4 量化版本,支持 100 万 token 上下文,最多可输出 131,072 个 token;在 Z.ai 自家 API 上的定价为每百万输入 token 1.40 美元、每百万输出 token 4.40 美元,缓存输入为 0.26 美元,混合费率为 0.90 美元。Artificial Analysis 测得它的输出速度为每秒 72.6 个 token、首 token 延迟 5.98 秒,运行完整索引的成本为 1,559.05 美元。
小米 MiMo-V2.6-Pro 于2026年9月22日正式全面可用,其强化学习检查点仓库在前一天发布。这是一个稀疏混合专家模型,总参数量达1.02万亿,每token激活420亿——总参数量大于GLM-5.2,激活量则几乎相同——具备100万token上下文窗口,原生支持文本、图像、视频和音频多模态,并采用MIT许可的权重。小米保持了上一代的定价,而没有上调价格,因此其标价为每百万token 0.43美元和0.87美元,缓存折扣达99%,混合价格为0.18美元。
• 权重 — 两者均采用 MIT 许可证且可下载;这是二者真正持平的唯一类别
• 激活参数——MiMo-V2.6-Pro 每 token 42B;GLM-5.2 约 40B。两者几乎相同,这使得分数差距是训练结果,而非规模结果
• 总参数量——MiMo-V2.6-Pro 1.02T;GLM-5.2 约 753B
• 指数得分 — MiMo-V2.6-Pro 46;GLM-5.2 34,两者均基于 Artificial Analysis v4.3.2
• 标价 — MiMo-V2.6-Pro 每 1M $0.43 / $0.87;GLM-5.2 $1.40 / $4.40,混合价 $0.18,而其为 $0.90
• 运行该指数的成本 — MiMo-V2.6-Pro 206.66 美元;GLM-5.2 1,559.05 美元
• 速度 — MiMo-V2.6-Pro 每秒输出 134.3 个 token;GLM-5.2 72.6
• 首个令牌时间 — MiMo-V2.6-Pro 2.15 秒;GLM-5.2 5.98 秒
• 状态 — MiMo-V2.6-Pro 为当前版本并已正式发布(GA);GLM-5.2 在 Artificial Analysis 上已被弃用,该平台现在仅以默认的 10k 输入工作负载对其进行基准测试

弃用通知才是头条
Z.ai 此后已发布 GLM-5.3,而 Artificial Analysis 的 GLM-5.2 页面也直接说明了这一点,将该模型标记为已弃用,并将后续基准测试工作限制在单一的默认工作负载上。这改变了本页面的用途。如果你今天要选择一款新模型,你真正关心的对决是 MiMo-V2.6-Pro 对 GLM-5.3,而不是 GLM-5.2——并且在同一个 v4.3.2 指数上,GLM-5.3 在最大努力下得分为 45,而 MiMo-V2.6-Pro 为 46。一分之差。这是一场真正的较量,也是一篇完全不同的文章。
GLM-5.2 的对比仍然值得一做,原因很具体:它能以最低的成本说明,开放权重的前沿在 2026 年 6 月到 9 月之间推进得有多快。大约十四周里涨了十二个指数点,而激活参数量基本没有变化。无论这一提升来自什么,它都不是规模。
GLM-5.2 曾经擅长什么,以及它是否依然如此
GLM-5.2 的发布材料主打编程和长时间运行的智能体工作,而这些数字作为对该模型的描述依然站得住脚:SWE-bench Pro 为 62.1,对比 GLM-5.1 的 58.4;Terminal-Bench 2.1 为 81.0,对比 63.5;FrontierSWE 为 74.4,对比 30.5。在知识与数学方面,它报告 GPQA-Diamond 为 91.2、AIME 2026 为 99.2,以及 Humanity's Last Exam 为 40.5。当时,它在一项长时程智能体编程基准上领先所有模型,并在一个公开的网页开发排行榜上排名第二。这些都是厂商在自家测试框架上报告的数字,而其中每一个都适用那句常见的提醒。
小米自己公布的 MiMo-V2.6-Pro 数据与它们并不可比,而这件事值得把原因说清楚,而不是含糊带过。小米报告称,在其强化学习训练过程中,该模型在 DeepSWE v1.1 上从 58.4 提升到 72.57,评估使用 mini-swe-agent、取三次平均,并采用自家的评分器;该次运行被记录为 30 步,在不到六天内完成约 750,000 条轨迹,公布的 Pro 模型花费约为 262 万美元。这些都不是排行榜上的条目。排行榜条目是在明确条件下对某一特定配置作出的、第三方可以复现的声明,而小米的并不是。另一个追踪榜单将 GLM-5.2 在 DeepSWE 上列为 46.2——这是 Pass@1,同一任务族上的不同指标——而把 72.57 与 46.2 并列以得出 26 分的差距,是在两个不同尺度上做算术。这不应该做,而这正是围绕这一对模型流传的最常见错误。

在它们之间做选择,以及使其变得廉价的路由
如果两者都是在同一许可证下的开放权重,那么决定性因素就是你能运行什么、以及你能在哪里调用它。GLM-5.2 已在 OrcaRouter 上,标识为 z-ai/glm-5.2——一个 OpenAI 兼容端点,供应商标价原样传递、0% 加价,因此 Z.ai 一调价,我们这边当天就同步生效。小米 MiMo-V2.6-Pro 不在 OrcaRouter 上;小米旗下没有任何模型在,要调用它,只能通过小米自家的平台,或某个收录了它的第三方目录。我们宁愿把这一点讲清楚,也不想让模型页面给出相反的暗示。
有用的结果是,你可以用一个密钥继续使用现有模型,并在此基础上评估新来者,而无需再签一份合同。如果 MiMo-V2.6-Pro 在你的提示上胜出,你以很低的成本就学到了这一点。如果它没有胜出——12 个点的指数差距,并没有每 token 价格差距那么大,因此结果确实取决于你的工作负载——那你除了这次测试之外什么也没损失。把两者放在同一个端点之后,并启用自动故障转移,也回应了对一款本周才发布的模型的实际质疑:单一服务路径就是单点故障,而一条可以回退的通道,才让新模型能够安全地置于真实流量之前。

简短的回答
如果你今天正在使用 GLM-5.2,而且它运行良好,那么升级问题就不是 MiMo-V2.6-Pro——而是同一血统的 GLM-5.3,它与小米模型仅差一分,且没有迁移成本。如果你是从零开始选择路线,并且想要三者中实测得分最高的开放权重,那么 MiMo-V2.6-Pro 的 46 就是那个数字,而它每秒 134.3 个 token 和每项索引任务 0.13 美元,正是它并非险胜的原因。如果你想要三者中最安全的,GLM-5.2 是错误答案,原因与它在六月有多好毫无关系:它是三者中唯一一个其自家厂商已经停止开发的。
OrcaRouter 将200 多个模型整合到一个兼容 OpenAI 的端点之后,按提供商标价提供,0% 加价,因此供应商一旦调价,当天即可生效。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
