《MiMo-V2.6:RL 论文揭示了什么》一文的主视觉标题卡,上方眉题为"技术报告",副标题为"小米的混合 RL 报告:解读其中已验证与未验证的内容"。四个圆角标签分别写着"冻结的 MoE 路由器"、"评分器成本 12.7%"、"DeepSWE 58.4 至 72.6"和"AA 指数 46"。页脚一行写着"DeepSWE 数据由厂商提供;AA 指数 46 由 Artificial Analysis 实测。"OrcaRouter 标志合成于右下角。
Guides & Insights

MiMo-V2.6:小米的强化学习论文究竟展示了什么,又有哪些尚未验证

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

本月发布的大多数模型论文都是架构论文。小米 MiMo-V2.6-Pro 和 Xiaomi MiMo-V2.6-Flash 背后的技术报告却不是。标题为 MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement,于 2026 年 9 月 21 日提交,署名 LLM-Core Xiaomi,它几乎没把任何篇幅花在稀疏混合专家骨干网络上,而是把几乎全部篇幅用在一个问题上:当整个后训练预算都投入单次混合强化学习运行时,会发生什么。相比之下,DeepSeek-V4.1-Flash 的报告则是一份内存文档——其篇幅用在了压缩稀疏注意力、跨层 KV 复用和 FP4 存储上。把两者并排放在一起,它们是在争论能力从何而来,而两者的答案并不一致。

这份报告就其自身而言值得一读,但值得仔细读,因为它来自运行了这次运行的实验室,是一份自我报告。它点明了自己的机制,展示了自己的消融实验,公布了自己的失败,却又在同一口气里报告了无法从外部核查的数字。把这两者区分开来,才是大部分工作。这篇文章正是这样做的,而且写于2026年9月23日——检查点上线两天后,当时这篇论文是关于它们的最新、也最缺乏佐证的东西。

为什么纸上的日期比平时更重要

小米的 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 检查点于 2026 年 9 月 21 日上线模型中心,采用 MIT 许可,无需申请即可获取。该报告的日期为同一天,并在其发布的预印本网站上登顶热门榜单。正是这一时间点,使这成为一篇新闻报道而非回顾性文章:这篇论文并非对一个所有人都已完成基准测试的模型事后作出的解释。它与模型权重同步到来,而此时小米之外的任何人都尚未发布独立的运行结果。

Screenshot of the MiMo-V2.6 technical report page captured September 23, 2026, showing the title 'MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement', attributed to LLM-Core Xiaomi and dated 21 September 2026, with the author list and the opening of the abstract visible.

这种排序也是这篇论文作为证据的主要弱点。由它衍生的一切——DeepSWE 曲线、通过率提升、针对奖励黑客行为的防御——都是关于一个训练过程的说法,而这个训练过程只发生过一次,是在一个实验室里、一个集群上发生的,且没有其他人复现过。指出该报告的那个讨论串把这一点视为有趣之处:这是一篇数据和实验论文,而不是架构论文,而实验恰恰是那种要么能被复现、要么不能的结果。

扩展的三个维度,其中只有一个是硬件问题

报告的框架是,强化学习的算力同时沿三个轴扩展,而第三个轴才是改变你对这一方法看法的那个。

• 批次与吞吐量 — 每次更新 1,568 个样本,每个样本扩展为十六次 rollout,因此每步大约 25,000 条轨迹,在上下文长度最高达 100 万个 token 的情况下,每步消耗 27 亿到 37 亿个 token。rollout 架构完全异步,这正是该批次规模竟然还能承受的原因。

• 环境——在代码、通用智能体、视觉和网络任务上,同时运行于多个智能体运行框架之下的一次混合训练,而非按领域分开进行的多次 RL 训练。小米自己给这件事起的简称是"You Only RL Once"。混合训练的理由是,某一能力的提升会带动其他能力;风险则是某一慢速任务类型会被饿死,报告称它通过自适应调度解决了这一问题。

• 评分器算力——这个维度并非通常意义上的 GPU。二元的通过/失败无法对两个都通过的方案进行排名,因此奖励信号本身就成了需要扩展的对象。智能体式评分器会联合比较同一任务的十六次尝试,并生成分级信号,而不是一个比特。

第三条轴正是标题中“自我改进”一词得以成立之处,也是这份报告最容易暴露短板的地方。模型给自己的 rollout 打分,本身就是一个 reward hacking 攻击面,而这份报告也正是这样看待它的。

真正值得理解的两个机制

群体优势再分配

每一步之后,策略都会为每个任务生成十六次尝试,并将它们全部放入一个共享工作区,以便评估器模型能够将它们放在一起考察,而不是逐一查看。随后,通过的补丁会从五个维度进行评分:方法是否契合问题、实现是否精确且没有不必要的兜底、改动是否最小、是否改动了范围之外的内容,以及是否符合周围的代码风格。排名较低的通过项获得的正向强化较少。被确认为取巧(hack)的补丁会被归零,并视为失败。

其后果是一种训练信号,它推动的是更短、成本更低的解决方案,而非仅仅正确的方案——报告将这种做法描述为引导每项任务使用更少的 token。这一点值得牢牢记住,因为论文后文的主要结果指向了相反方向。

分组奖励合成

同一思路的离线那一半。团队不是纯粹从实时评分器得出质量,而是预先计算任务特定的评分标准,并将二元测试奖励乘以由这些评分标准得出的质量和行为分数。报告将此描述为从对比性 rollout 构建评分标准——也就是从结果不同的案例中构建,因为信息就在那里。

评分并非没有成本。报告估算,评分器成本约占 MiMo-V2.6-Pro 强化学习总成本的 12.7%。对于任何考虑复制该方法的人来说,这个单一数字是论文中最有用的信息,因为它把“扩大你的评分器规模”从一种想法变成了一项支出明细。

冻结的路由器是大多数团队会首先复制的结果

报告的稳定性部分包含一项独立成立的发现,它与 MiMo-V2.6 无关,也与该模型的性能好坏无关。

在使用可训练的专家混合路由器时,专家负载在二十步内严重漂移。各专家之间的变异系数从 0.78 升至 2.0。最繁忙专家的峰值负载从平均值的六倍升至十六倍。冷专家——即几乎接收不到任何流量的专家——的占比从 0.5% 升至 22%。在第 20 步将路由器权重恢复到其初始值时,均衡立即得以恢复。

小米的应对方式是在本次训练运行中冻结 MoE 路由器。其理由并不隐晦:在如此大的批规模下,路由不稳定是一个你完全可以拒绝让其存在的训练动力学问题,而路由器并不是强化学习真正起作用的地方。冻结是否会在最终质量上造成代价,公开材料中并没有消融实验来回答,而想要知道这一点是合情合理的。

该发现没有涉及的是服务方面。训练运行期间的路由器负载均衡与生产流量下的专家利用率是两个不同的问题,而报告只讨论了前者。

这些数字,连同它们附带的标签

这份报告的头条结果在形态上干净利落,在细节上却杂乱无章,而这种杂乱并不是什么丑闻——它是对三个同名却不同的对象所做的三种不同测量。

• DeepSWE v1.1(留出集)——MiMo-V2.6-Pro 在整个运行中从 58.4 升至 72.6;MiMo-V2.6-Flash 从 48.7 升至 65.7。该基准包含 113 个长时程仓库工程任务,涵盖五种编程语言,由功能验证器进行评判,指标为 average@3——三次采样尝试的平均验证器通过率,这与三次尝试中是否有任何一次成功并不相同。将 avg@3 理解为 pass@3 会高估页面上的每一个数字。

• 同一个基准,在别处测得的数值——已发布的模型卡上,Pro 为 71.9,Flash 为 67.9。小米公开的训练仪表盘显示的是 72.57 和 65.68。因此,每个模型都有三个已公布的数字,其中两个来自小米,而这一差异的方向对两个同门型号来说并不相同。它们都没有错;它们分别描述的是不同时间点、且可能在不同评测框架下的仪表盘快照、模型卡条目和报告中的一行。

• 蒸馏——MiMo-V2.6-Distill-Qwen-9B 基于 MiMo 生成的演示数据,从 Qwen3.5-9B 微调而来,将 SWE-bench Verified 从 61.1 提升到 66.2。这是论文中最具可迁移性的数字,因为 9B 学生模型的规模是大多数团队实际能够运行的。

• 一项内部的网络安全小型基准测试 —— 31.3 到 47.0。内部就是内部:这些任务并未公开,因此即便在理论上也无法复现该差值。

• Artificial Analysis 智能指数——MiMo-V2.6-Pro 得分 46。这个数字在性质上有所不同。它是由 Artificial Analysis 使用自有的评测工具链,对已发布的模型检查点进行测试得出的,而非小米自己产出,这使其成为本次发布中唯一一个读者可以视作"实测"而非"宣称"的核心数字。它也是用来与 GLM-5.3、Kimi K3 以及闭源前沿模型进行对比的那个数字,并且比 Claude Opus 5 低五分。

A scoreboard card titled 'Published by Xiaomi vs verified from outside', subtitled 'Every headline figure in the report, and who stands behind it', with columns 'Dimension', 'In the report' and 'Independent status'. Rows read: DeepSWE v1.1, held out — 58.4 to 72.6 Pro; 48.7 to 65.7 Flash, average@3 — No third-party rerun; Released model card — 71.9 Pro; 67.9 Flash — Vendor-published; Public training dashboard — 72.57 Pro; 65.68 Flash — Vendor-published; Distill-Qwen-9B — SWE-bench Verified 61.1 to 66.2 — No third-party rerun; Internal cyber benchmark — 31.3 to 47.0 — Tasks not published; AA Intelligence Index — 46 for MiMo-V2.6-Pro — Measured by Artificial Analysis. A footer reads 'DeepSWE, card and dashboard figures are vendor-reported and have not been independently reproduced; the internal benchmark tasks are not published. The AA Intelligence Index is the one headline number produced outside Xiaomi.' The OrcaRouter logo is composited in the bottom-right corner.Screenshot of the Artificial Analysis model page for MiMo-V2.6-Pro captured September 23, 2026, showing an Intelligence Index of 46, an Intelligence versus Cost scatter placing MiMo-V2.6-Pro against Kimi K3, Claude Opus 5 and other frontier models, and a comparison table of the same models.

这份报告诚实地承认了自身表格的局限,而这正是值得拿来回应那些不承认局限之人的一句话:这些比较混合了公开基准与内部基准,并未将强化学习的贡献与架构或预训练的贡献区分开来。一个模型在强化学习之后变得更好,并不能证明强化学习就是原因所在。

还有第二个警告,而这个警告与那种框架相悖。报告中的收益通常伴随着 token 使用量的上升。报告将其呈现为持续的能力提升,而非效率提升,这样做是对的。但 GAR 的明确设计目标是引导向更短的路径和每项任务更少的 token,而总体结果并未显示工作负载变得更便宜。能力提升了;每项任务的成本并未下降。如果你把“自我改进”理解为“模型下一季度会需要我更少的钱”,那么这篇论文并不支持这种解读。

报告未予核实的内容

截至 2026 年 9 月 23 日,没有任何第三方公布过对 DeepSWE、Terminal Bench 或 CyberGym 各列的独立复跑。真正重要的区别在于指数点与其他一切之间:46 是别人做出的一项测量,而 72.6 则是关于一次没人能重新执行的训练运行的声称,因为据报道,这次运行在 Pro 上花费了 260 万美元,在 Flash 上花费了 90 万美元,而且不会发生第二次。

Xiaomi 确实发布了大多数实验室都不会发布的东西:训练动力学、强化学习框架以及任务环境——涵盖软件工程、漏洞复现、知识工作和网页设计的 7,000 多个分级环境。那才是保质期最长的产物。权重告诉你这次运行产出了什么;环境则告诉你如何自己运行这个实验,而这是任何 RL 主张最终得以定论的唯一途径。

针对奖励黑客行为的防御值得一个具体的限定说明。它被描述为多层次的——奖励设计、对抗性评估、异常检测以及验证器之间的交叉检查——而描述它的,恰恰是那个一旦它失效就会颜面尽失的一方。针对模型欺骗基于模型的评分器的防御,不是一份自我报告就能了结的事情。机制被点名,失效模式也被承认,这已经比大多数论文做得更多,但它仍然是一个悬而未决的问题。

你今天实际上能用这个做什么

两个检查点均可下载、无需申请,采用 MIT 许可标签:Xiaomi MiMo-V2.6-Pro-RL 和 Xiaomi MiMo-V2.6-Flash-RL,均为全模态,拥有一百万 token 上下文,其中 Flash 索引显示,FP8 格式下 65 个分片中共有 172.9 GB 权重数据。小米尚未发布 V2.6 代的每 token 价目表,因此如今的选择是在自托管与你已在付费使用的托管模型之间做取舍。

这种对比正是这篇论文现实价值所在,而它对论文本身并不客气——却是有益的那种不客气。这里要检验的命题不是“MiMo-V2.6-Pro 好不好”——那 46 个答案已经回答了这一点。真正的命题是“在混合智能体任务上做强化学习,所产生的推理能力能否迁移到我的工作负载上”,而要诚实地回答这个问题,唯一的方法就是把两者都跑一遍再比较——这首先是一个路由问题,其次才是研究问题。DeepSeek-V4.1-Flash 离你只差一个 API key,价格为每百万 token $0.15 和 $0.60,Qwen3.8-Flash 和 GLM-5.3-Flash 就在同一个 key 上,而如果你想把自己托管的 MiMo 检查点接到同一个端点后面跑上一周,看看 DeepSWE 曲线会不会出现在你自己的评测里,那只是一次配置变更,而不是一次迁移。OrcaRouter 并不托管小米的模型,本文任何内容都不应被解读为在暗示相反的情况——但你会拿来给它们做基准对比的那些模型,都可以通过一个 OrcaRouter API key,按提供商标价、0% 加价透传,并且如果你正在试用的某个检查点在高负载下被证明不稳定,还能自动故障转移。

未经验证的模型这一类情况,正是故障转移机制为之而生的场景。一个两天前发布的检查点,评估由厂商自己完成、没有独立复现,恰恰就是那种你会想拿来试一试、却又不会让生产路径依赖它的东西。

谁应该阅读这篇论文

如果你做后训练,读它是为了了解关于路由器的发现和评分器成本数据。两者都可移植,测试起来也都便宜,而且都不取决于你是否相信 MiMo-V2.6 基准表中的任何内容。尤其是冻结路由器这个结果,正是那种花一个下午就能试、却能省下一轮训练的东西。

如果你是在选模型,那就读一下那个指数分数,其余部分可以略过。Artificial Analysis 在已发布的产物上测得了 46 分;这是本次发布中唯一一个并非来自厂商的数字,它让 MiMo-V2.6-Pro 位居开放权重领域之首,落后 Claude Opus 5 五分。报告中的其他内容都在讲述小米是如何做到这一点的,而小米做到这一点的方式,并不是你能买到的。

如果你读的是报道而非论文本身,需要注意的关键词是"自我改进"。报告自身的结果显示,能力随 token 使用量一同提升,这是关于扩展强化学习的一个真实且可复现的发现。这并不是说模型的运行成本变低了,而后续的论文才会告诉你它最终是否会变低。