
小米 MiMo-V2.6-Pro 以 46 分登顶开放权重指数——并公开训练账单
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro 现已成为 Artificial Analysis Intelligence Index 上排名最高的开放权重模型,在 v4.3.2 上得分为 46——领先 GLM-5.3 一分,领先 Kimi K3 两分,并比其前代 MiMo-V2.5-Pro 在较早指数标准上录得的 26 分高出二十分。这个数字是由 Artificial Analysis 用其自有测试框架跑出来的,而非小米,而它是本次发布中最有用的一个事实。第二有用的事实是旁边印出的价格:每百万输入 token 0.43 美元,每百万输出 token 0.87 美元,而 Claude Opus 5 则为 5.00 美元和 25.00 美元——一款指数高出五分的模型。第三个则是没人料到小米会交出的东西:对产出 MiMo-V2.6-Pro 的那次强化学习运行实际花费的公开核算。
分数是一种衡量,而非断言
几乎所有关于中国模型发布的报道都以厂商数据的形式出现,读者早已学会对此大打折扣。这一次有所不同,而这个不同值得被精确对待,因为发布报道已经把它模糊了。
Artificial Analysis 对 MiMo-V2.6-Pro 本身进行了评估,采用的是 v4.3.2 综合评测集——十项评测,涵盖推理、知识、数学和编程,包括 AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience 和 AA-LCR v1.1。46 分就是这套评测集给出的结果。它还记录了决定一个模型是否可用、而非仅仅优秀的运行特征:每秒 134.3 个输出 token,首个 token 耗时 2.15 秒,99% 的缓存折扣,以及每项 Intelligence Index 任务 0.13 美元的实测成本。
其中两项值得着重说明。每秒 134.3 个 token 的速度,让 MiMo-V2.6-Pro 在 114 个模型中速度排名第十一——对于一个万亿参数的混合专家模型而言,这是服务端的结果,而不只是训练端的结果。而每任务 0.13 美元这个数字,是真正能扛住预算考验的数字:它是指数针对该模型实际运行所产生的成本,对所有上榜模型都采用同一套测量方式,因此具备可比性,而这是那些只做宣传的每 token 费率所不具备的。

该指数涵盖与不涵盖的内容
开源权重领域的桂冠是真实的,但比表面读起来要窄。在 46 分上,MiMo-V2.6-Pro 领跑开源权重类别。它并未领跑整个指数榜。v4.3 的榜首是最大努力、默认回退设置下的 Claude Fable 5.1,以及最大努力下的 GPT-6 Astra,二者均为 53 分,紧随其后的是 51 分的 Claude Opus 5 和 50 分的 Claude Fable 5。因此,诚实的表述是:在一个奖励广度的综合评分上,与前沿相差五分;相较于小米自己的上一代,则提升了二十分。
• 开放权重领先者——小米 MiMo-V2.6-Pro 46、GLM-5.3(max)45、Kimi K3(max)44
• 同一指数榜首 — Claude Fable 5.1(max,fallback)53,GPT-6 Astra(max)53,Claude Opus 5(max)51
• 速度 — 每秒输出 134.3 个词元,在 114 个被测模型中排名第十一;该规模类别的中位数为 77.9
• 首个 token 响应时间——2.15 秒,中位数为 2.34 秒
• 每个 Intelligence Index 任务的成本 — 0.13 美元,整个评估运行成本为 206.66 美元
• 标价 —— 每百万输入 token 0.43 美元、每百万输出 token 0.87 美元、99% 的缓存折扣,以及在 7:2:1 的缓存命中/输入/输出混合比例下为 0.18 美元的混合价
Artificial Analysis 页面上的一个数字并非自夸,而是一个实实在在的提醒:在撰写本文时,它只统计到 MiMo-V2.6-Pro 的一家 API 提供商。这正是该模型当下的实际瓶颈,而且问题不在于质量,而在于可用性。一条路由可达的模型没有故障转移。如果这条路由性能下降,你的应用也会随之下降,而故障转移恰恰是路由器存在的意义所在。对于任何围绕此次发布做规划的人来说,一个相关的观察是:我们并不托管 MiMo-V2.6-Pro,我们也不会假装托管;如今通往它的路径是小米自家的平台,以及少数将其列入目录的第三方渠道。

绝不能混淆的两个数字
小米也公布了自己的基准测试数据,而它们与46是不同类别的对象。该公司的仪表盘报告称,MiMo-V2.6-Pro 在其强化学习运行中于 DeepSWE v1.1 上从 58.4 提升到 72.57,评估使用 mini-swe-agent,取三次平均值。那是小米自己的测试框架、小米自己的评分器、小米自己的离线运行。它尚未提交到公开的 DeepSWE 排行榜,也没有被任何人复现。
把两者并排放在一起看,就会忍不住把 72.57 当成与公开 DeepSWE 榜单列在最高档的 74% 同级别的分数。它们并不在同一尺度上。榜单上的数字是提交的配置,Pass@1,附有已公布的置信区间和每任务平均成本;厂商的数字则是内部评估,这些都没有附带。我们自己在 9 月 21 日的文章里就提出过这一点,当时这些数字还只是仪表盘读数;如今权重已经公开,这一点依然成立。厂商的测评框架可以完全诚实,却仍然不能算作榜单条目,因为榜单条目是关于特定条件下特定配置的声明,第三方可以复现。
同样的原则也适用于训练支出。小米报告称,Pro 和 Flash 两次运行合计约为 3,474,715 美元——其中 Pro 为 2,620,670 美元,Flash 为 854,044 美元——每次运行超过三十个强化学习步骤,各自约有 750,000 条轨迹,并在不到六天内完成。这些是该公司自己的算力核算数据。它们之所以引人关注,是因为实验室几乎从不公布这些数据,而且它们不是 API 价格,不是你需要支付的费用,也不是任何第三方审计过的数字。
小米实际发布的是什么
此次发布的是一个稀疏专家混合模型,总参数量为 1.02 万亿,每个 token 激活 420 亿参数,具备 100 万 token 的上下文窗口,并原生支持文本、图像、视频和音频的多模态能力。其同系列模型 Xiaomi MiMo-V2.6-Flash 采用相同架构,但规模更小,总参数量为 3090 亿,激活参数量为 150 亿。已发布的权重带有 MIT 许可证标签,发布包中包含一份技术报告、部署说明,以及——据 Xiaomi 称——用于检查和复现后训练的强化学习训练环境和代码。
最后一项才是这次发布与典型 API 公告之间的实质性差异,值得把它和营销话术分开来看。发布 RL 环境,等于宣称训练设置是可检验的。已发布的环境是否足以复现 72.57,是一个单独的问题,将由尝试复现的人而非发布说明来定论。小米自己的训练笔记描述了这样一次运行:在单次通过中混合了编码、通用智能体、视觉和网络安全任务,并由评分器对成功轨迹进行排名,同时将奖励重新分配给更优路径——而这些笔记也记录了失败:由专家负载不均衡导致的 GPU 显存不足重启、训练集群与评分器部署之间的网络故障,以及一次基础设施错误约三小时未被发现后发生的 Flash 重启。把故障与成功一起发布,正是让披露其余部分可信的关键。
呼叫的费用是多少,以及路由问题位于何处
每百万 token 0.43 美元和 0.87 美元,MiMo-V2.6-Pro 的定价像一款中端模型,而基准测试表现却像一款前沿开放权重模型。Xiaomi 沿用了上一代 MiMo-V2.5 的标准定价,而没有为新检查点上调价格,这就是为什么相比参数量,这个费率看起来偏低。99% 的缓存折扣意味着缓存密集型的 agent 循环读取其上下文几乎不花什么钱,而长时程 agent 的账单恰恰是在这里累积起来的。
这种交易有一种能顺畅路由的版本,也有一种不能的版本。能顺畅路由的版本是这样的:你会用来与 MiMo-V2.6-Pro 对比的那些前沿模型——定价 $5.00/$25.00 的 Claude Opus 5、GPT-6 Astra、Gemini 3.8 Flash、GLM-5.3——都可以通过一个 OrcaRouter 密钥、按供应商标价、以 0% 加价触达,因此其中任何一家降价,当天就会在我们这边生效,而一条路由规则可以在首选模型响应缓慢或不可用时把请求转给第二个模型。这一点在这里比平常更重要,因为开放权重得分最高的那个模型,恰恰也是通往它的路径最窄的那个。把两者组合起来——用廉价的开源权重通道处理批量工作,用前沿通道处理难啃的长尾——本身就是一个路由决策,而一旦两条通道都在同一个密钥之下,这种决策就不再是一场押注了。
还有一个产品需要厘清,因为它很容易与模型混为一谈:小米还提供 MiMo-V2.6-Pro-UltraSpeed,这是基于同一检查点构建的托管服务层级。小米自己的材料宣称,在相同质量下,输出速度最高可达标准 Pro 服务的二十倍;第三方目录列表则描述为大约十倍。这两个不同数字描述的是同一层级,没有人发布过能调和它们的单请求延迟分布,而且该层级的费率显著更高。UltraSpeed 不会改变权重能做什么——它改变的是别人服务器运行这些权重的速度。
什么会改变这张图?
三件事,按它们的重要性排序。
第二条和第三条服务路径。Artificial Analysis 上仅有一家提供商这一计数结果,构成了对其他一切的约束。更多路径意味着故障转移,意味着服务层的价格竞争,也意味着模型可以被放进生产链路,而不只是一个实验。
DeepSWE 数据的独立复现。46 已经是独立结果;72.57 则不是。如果外部测试得出的结果与之接近,这款模型的说服力就会大幅增强。如果它们明显低于该数值,那么值得信任的仍然是 Artificial Analysis 的数字,而厂商的这一数字则会加入那一长串经不起检验的发布宣传之列。

逐项评估的细分结果。综合分终究只是综合分。MiMo-V2.6-Pro 在十项评估中赢下哪几项、输掉哪几项,决定了你是把它部署用于智能体编程,还是部署用于检索密集型问答,而仅凭这个指数并不能告诉你这一点。这个细节就是接下来该关注的内容,也是路由配置在值得写下来之前所需要的信息。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
