文章《Xiaomi MiMo-V2.6-Pro:DeepSWE 得分 72.57》的横幅标题卡,肩题为"OrcaRouter · 模型雷达 — 尚未发布",副标题为"一次中断的运行,一个尚未发布的模型——哪些已确认,哪些尚未确认。"其下有两张卡片:左侧为"在小米自家仪表盘上",内容为"DeepSWE v1.1:72.57 — 运行于 9 月 20 日在第 30 步停止";右侧为"仍未公开",内容为"没有模型卡,没有 API ID,没有价格,没有权重"。四枚标签分别写着"Flash 同门型号:65.68"、"总花费:$3,474,715"、"榜首:74%"以及"厂商自跑评测,未提交"。OrcaRouter 标志合成于右下角。
Guides & Insights

小米 MiMo-V2.6-Pro:72.57 的 DeepSWE 得分、一次戛然而止的运行,以及依然没有发布日期

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Xiaomi MiMo-V2.6-Pro于9月20日停止了其公开直播的强化学习运行,DeepSWE v1.1 得分为72.57,就挂在小米自家的仪表板上——比同一排行榜榜首的 GPT-6 AstraGemini 3.8 FlashClaude Opus 5 并列的 74% 低 1.4 个百分点。与其一同训练的更小模型 Xiaomi MiMo-V2.6-Flash 于9月19日停止,得分为 65.68。两次运行均在第 30 步结束,而我们今早抓取该页面时,小米随附公布的两者合计账单为$3,474,715

好消息就这些,而且确实算得上好消息。故事的其余部分,是一个数字与一款产品之间的落差。Xiaomi MiMo-V2.6-Pro 和 Xiaomi MiMo-V2.6-Flash 都没有发布日期,没有模型卡,没有 API 标识符,没有公布价格,也没有可供下载的权重。没有任何可调用的端点。存在的只有一个任何人都能观看的训练仪表盘、一个由小米自家评测框架跑出的基准数值,以及一个花了六天时间盯着遥测页面看的社区——就像过去人们读茶叶渣那样。

所以,这是一篇“截至目前我们所知”的文章,而它诚实的版本会把过去一周报道一直悄然混为一谈的三件事区分开来:小米已经公开记录在案的内容、某位观察者对此的报道,以及这一切对今天正在选择编码模型的人意味着什么。

小米实际放上线了什么

9月16日,由罗福莉带领的MiMo团队在小米自有域名下上线了一个直播页面,实时展示两个尚未发布模型的后期训练过程:步数、奖励曲线、token吞吐量、沙箱数量、GPU故障提示,以及一个随着观看而不断上涨的成本计数器。根据相关报道,小米的说法是,它花了大约六个月时间研究一个问题——强化学习究竟能被扩展到什么程度——并决定公开进行这项实验,而不是公布一个结果。

对于一份厂商发布的材料而言,这个仪表板坦诚得非同寻常。它在通知流中列出了自身的失败记录:一次 Pro 在第 17 步的重启,由专家负载不均衡引发的 GPU 显存溢出故障导致,团队称已通过调整其训练并行策略修复;Pro 训练集群与评分部署之间的一处网络连接故障,迫使系统重启,并在“运行日志中出现不良模式”后决定从即将进行的 Pro 训练中剔除 cyber 数据集;一次 Flash 从第 15 步开始的重启,起因是一类基础设施错误约三小时未被检测到;以及一次因单节点 VRAM 故障导致的 Pro 重启。它还指出,被判定为“对当前 Pro 模型相对容易”的任务已被过滤掉——这是大多数后训练报告避而不谈的坦白。

Screenshot of Xiaomi's public MiMo-V2.6 reinforcement-learning dashboard captured September 21, 2026. A total-cost counter reads $3,474,715, and a notices feed lists a Pro restart at step 17 from a GPU out-of-memory fault caused by expert load imbalance, a network connectivity fault between the Pro training cluster and the grader deployment, a Flash restart from step 15 after an infrastructure error went undetected for about three hours, a Pro restart from a node VRAM fault, and a note that tasks relatively easy for the current Pro model were filtered out. Two run cards show mimo-v2.6-pro stopped at step 30 — started 2026-09-15 10:32 UTC, stopped 2026-09-20, $2,620,670 spent, 75B tokens, 753k samples, batch 1,568 x 16 — and mimo-v2.6-flash stopped at step 30 — started 2026-09-15 15:16 UTC, stopped 2026-09-19, $854,044 spent, 81.4B tokens. Three benchmark panels read DeepSWE v1.1 mini-swe-agent avg@3: mimo-v2.6-pro 72.57, mimo-v2.6-flash 65.68; an in-house coding bench at 65.43 and 62.87; and AutomationBench v1.0.6 at 53.10 and 52.70.

两张运行卡片是任何关注时间安排的人都关心的部分。两个模型都标记为已停止:MiMo-V2.6-Pro 在墙钟时间 5 天 7 小时后停止,MiMo-V2.6-Flash 在 3 天 11 小时后停止,二者均处于 step 30,日期分别是 9 月 20 日和 9 月 19 日。Pro 为其 $2.62M 消耗了 75B tokens 和 753k samples;Flash 消耗了 81.4B tokens,花费 $854k。每一步抽取一批 1,568 个 prompts,每个 prompt 有 16 次 rollout——每步 25,088 条轨迹,完全异步运行。

值得直说:小米并未说明“停止”是指运行已完成、已暂停,还是已存有检查点。一张停止的卡片并不等于完成通知,团队之外没人知道它究竟是哪一种。

什么是已确认的,什么是未确认的

72.57 不是传闻。它印在 Xiaomi 的仪表盘上,在一张标有 DeepSWE v1.1、mini-swe-agent、avg@3 的图表中,紧挨着 Pro 运行的橙色曲线。Flash 模型的 65.68 也位于同一张图上。这个数字还出现在同一面板更早的快照中——先是 62.24,后来是 65.97——正是这一点赋予了曲线这样的形态:在 30 步中稳步攀升,而不是一次侥幸的评估。

仅属报道性质的内容才是起点。9月21日在X上流传的说法,来自账号@nrehiew_,称Pro模型在DeepSWE上“从58.41升至72.57”,且这些运行已经完成。该终值与厂商仪表盘完全吻合。58.41这一基线是该账号对曲线起点的解读——图表上最左侧的Pro数据点确实位于50多的高位——而小米并未公布第一步的数值。关于已完成的说辞同样是对两张标记为已停止的卡片的解读,这是一种合理的理解,而非小米的声明。请将这14点的提升视为方向上可靠、数值上仅为近似。

A two-column scoreboard titled 'MiMo-V2.6-Pro vs the DeepSWE top tier', subtitled 'What Xiaomi published about its own checkpoint, against what the public leaderboard lists — September 21, 2026'. The left column, badged VENDOR-REPORTED and headed 'MiMo-V2.6-Pro', reads: DeepSWE v1.1 — 72.57; Basis — Xiaomi's own offline eval, mini-swe-agent avg@3; Confidence — not published; Cost per task — not published; Release — not announced; Independent runs — none. The right column, badged PUBLIC LEADERBOARD and headed 'Top tier — three-way tie', reads: DeepSWE v1.1 — 74%; Basis — submitted configs, Pass@1, GPT-6 Astra · Gemini 3.8 Flash · Claude Opus 5; Confidence — plus or minus 1 to 4 points; Cost per task — $2.36 to $11.84; Release — shipping today; Independent runs — on the public board. A footer reads 'MiMo-V2.6-Pro is Xiaomi's own offline evaluation, read from the vendor's public RL dashboard on 2026-09-21 and not submitted to the leaderboard. Top-tier figures per Datacurve's DeepSWE v1.1 leaderboard, updated 2026-09-03.' The OrcaRouter logo is composited in the bottom-right corner.

报道还漏掉了一处区别,而正是这一区别决定了这个数字有多大价值。仪表盘上的基准面板是小米自己的评测:公司用自己的检查点运行了该测试框架,并公布了结果。这个测试框架与公开排行榜所用的是同一个——mini-swe-agent、DeepSWE v1.1——这使该数字比厂商自研基准更具可比性。但自行开展的评测并非排行榜上的条目,72.57 并没有出现在 Datacurve 的榜单上,因为没有人提交过它。

74%的上限比标题所暗示的更严格。

这就让对比变得清晰了。Datacurve 的 DeepSWE v1.1 排行榜最后更新于 2026 年 9 月 3 日,列出了五种语言、91 个代码库中的 113 个任务,其排名前三的配置以 74% 的 Pass@1 并列:GPT-6 Astra 在 xhigh 推理强度下,Gemini 3.8 Flash 在 high 下,以及 Claude Opus 5 在 max 下。真正有意思的,是紧挨着这些分数的那几个数字。

• 置信度 — GPT-6 Astra 74% ±3,Gemini 3.8 Flash 74% ±1,Claude Opus 5 74% ±4。在同一榜单上,GPT-5.6 Sol 为 73% ±3,GLM-5.3Kimi K3 为 69%。这些区间的重叠远远越过了小数点后第二位。

每项任务成本——Gemini 3.8 Flash 平均为 $2.36,GPT-6 Astra 为 $6.52,Claude Opus 5 为 $11.84。排行榜自己的图表将 Gemini 3.8 Flash 标记为榜单上最高效的配置,而这三者之间的差距约为五比一,对应的通过率却是该基准测试无法区分的。

• 步数——Gemini 3.8 Flash 平均每个任务需要 166 个智能体步骤,Claude Opus 5 为 99 个,GPT-6 Astra 为 29 个。平分的结果掩盖了三种截然不同的工作方式,而最便宜的那个恰恰是干活最卖力的。

Screenshot of Datacurve's DeepSWE v1.1 leaderboard captured September 21, 2026, showing 113 tasks, 91 repositories, five languages and 28 models, with the v1.1 and Best tabs selected and the board marked 'updated September 3, 2026'. The Pass@1 table lists gpt-6-astra (xhigh) at 74 percent plus or minus 3 with an average cost of $6.52, 30k output tokens and 29 steps; gemini-3.8-flash (high) at 74 percent plus or minus 1 at $2.36, 143k tokens and 166 steps; claude-opus-5 (max) at 74 percent plus or minus 4 at $11.84, 118k tokens and 99 steps; gpt-5.6-sol at 73 percent; claude-fable-5 at 70 percent; glm-5.3 and kimi-k3 at 69 percent; and grok-4.6 and gpt-5.6-luna at 67 percent. The score-versus-average-cost chart above the table labels gemini-3.8-flash as the most efficient configuration. No Xiaomi MiMo model appears on the board.

因此,当被报道的 72.57 被描述为“接近榜首”时,更准确的说法其实更狭窄,也没那么戏剧化。它与一个三方并列的成绩相差约 1.5 分以内,而该基准测试自身的误差范围无法将并列中的各方彼此区分开。对于一个仍处于后训练阶段的模型来说,这是一个强劲的结果;它由厂商而非基准测试的维护者产出,而且是在一个该模型尚未被提交到的榜单上。排行榜的上一次更新完全早于小米的这次运行,这也是为什么榜单上至今还没有出现任何 MiMo 的身影。

为什么小米在公开训练

这种透明并非偶然。小米上一次开放权重的发布是 4 月底的 Xiaomi MiMo-V2.5 和 Xiaomi MiMo-V2.5-Pro,两者均采用 MIT 许可证——可商用、可微调、可再分发。MiMo-V2.5-Pro 是一个 1.02 万亿参数的混合专家模型,拥有 420 亿激活参数、混合注意力架构和 100 万 token 上下文窗口,其发布材料明确提出了智能体能力主张:一个用 Rust 从零编写、历经数百次工具调用的编译器,以及一个经过十一个小时智能体工作构建的八千行桌面应用程序。

把下一代模型的后训练过程直播出来,是一种性质完全不同的主张。一个实时公布其奖励曲线、沙盒数量和 GPU 故障的实验室,是在要求人们以过程而非发布会 PPT 来评判它,同时也在释放某种时间表信号。罗福莉表示,RL 工作的技术细节将在未来几周内逐步开源。这是目前各方给出的最接近时间表的东西:先方法论,后模型。

这也符合小米此前用过的一种模式:某个模型先以另一个名字公开出现,随后公司才正式认领。该公司的习惯是悄悄训练、公开测试,然后再带着权重发布。

你今天可以运行的内容

MiMo-V2.6 系列中没有任何东西。如果你现在就想用上一个 Xiaomi MiMo 模型,目前存在的是 V2.5 代——通过 Xiaomi 自有渠道和若干第三方平台开放权重,并附有已公开的模型卡和定价。不存在 MiMo-V2.6 API,不存在模型标识符,也不存在价格表;任何引用 MiMo-V2.6 标识符或每 token 费率的页面,都是在填补 Xiaomi 留下的空白。仪表盘上的 `mimo-v2.6-pro` 和 `mimo-v2.6-flash` 字符串是训练任务名称,而不是已发布的端点。

另一个实际后果是:在此期间该怎么办。如果 MiMo-V2.6-Pro 让你感兴趣的原因,是它可能是一条以更低成本达到前沿级编码性能的途径,那么用来与它对比的那些配置如今已经可以调用,而排行榜表明,便宜的那个很有竞争力:Gemini 3.8 Flash 以每任务 2.36 美元的成本并列最高通过率,并被标记为该榜单上最高效的配置。Gemini 3.8 Flash、Claude Opus 5 和 GPT-6 Astra 都可以通过同一个 OrcaRouter API 密钥、按提供商标价访问,0% 加价直接传导——因此供应商的价格变动当天就会在我们这边生效,而不是等到下一个计费周期——并且故障转移是按模型配置,而不是按供应商配置。而当某个实验室真的开放像这样的模型时,把它接入同一个密钥之下,是评估它的一种低投入方式:你可以把它放在真实流量前面,而不必把生产路径押在一个没人评估过其特性的检查点上。

到底什么才能真正改变这个故事

四个信号,大致按照它们能解决问题的程度排序:

• 权重在 Hugging Face 上以明确声明的许可证发布,这正是 V2.5 一代问世的方式,也是 RL 运行产出了一个可交付的模型、而非一个就此终止的实验的最有力证据。

• 一张包含参数量、上下文长度和架构的模型卡——V2.6 的任何数字都未公开,仪表盘也不显示它们。假设 V2.6-Pro 继承 V2.5-Pro 的 1.02T/42B 形态,那只会是猜测。

一个 API 标识符和一份价目表,这一刻,DeepSWE 的数字不再是旁观者的运动,而成为采购决策。

• 向 Datacurve 的 DeepSWE 榜单提交,这将使 MiMo-V2.6-Pro 与被拿来比较的模型出现在同一张表上,并处于相同的误差线之下。厂商自行开展的评估与榜单提交并不是同一种主张,而两者之间的差距恰好就是那张表上的一行。

在那之前,诚实的总结是:小米在它尚未发布的两款模型上,展示了任何主要实验室所公开过的最透明的后训练过程,并带有一个自报的基准分数,该分数接近——但并未跻身——排行榜榜首。方法论说明承诺将在未来几周发布。发布日期则完全没有承诺。